对齐评测的本质:把抽象价值观变成可测量行为
“模型安全吗”“模型有没有幻觉”如果只停留在感受层面,就不是科研项目。这个方向要做的是设计题目、rubric、标注流程和统计指标,让不同模型在相同规则下被比较。
小白入门不必一开始训练 RLHF 模型,可以先做评测:收集问题、定义评分维度、比较人工评分和 LLM judge,最后分析模型在哪些场景会误答、拒答过度或编造事实。
- 输入通常是用户指令、风险问题、候选回答、证据来源和人工偏好。
- 输出是偏好排序、安全标签、幻觉定位、多维评分或模型排行榜。
- 难点在于评测标准是否稳定:judge 偏差、题库覆盖和人工一致性都要说明。