深色模式
14 · 评测进阶
从人工打分到自动化评测
📚 《AI 知识库开发入门》第 14/20 篇 · 下一篇:15 · 权限与安全
评测要从"项目"变成"习惯":每次改动跑回归。
01 LLM 当裁判
用另一个模型按标准答案给回答打分,规模化人工做不了的量。裁判要换家模型——同款模型自评自夸,分数虚高。
02 核心指标人话版
忠实度(答案是否忠于检索到的资料)、答案相关性(答没答到点上)、上下文相关性(捞回的资料对不对)、召回率(该捞的捞到没有)。RAGAS 类框架给了现成实现。
03 badcase 归因
流程图一句话:先看检索日志——没捞到是检索问题(回第 9-11 篇),捞到了答歪是生成问题(回第 12 篇)。
04 动手
把评测集升级为自动化跑分 → 验收:一键出分 + 每次改动的回归记录。
05 小结
自动化评测是质量的复利。下一篇上安全课。
📎 实战案例
团队用和生成同款的模型当评测裁判,分数漂亮、上线打脸。换家模型当裁判、并把 badcase 归因(先看检索日志再动 prompt)流程化后,评测第一次可信——裁判独立性是常识却总被忘。
踩坑
- 我用同款模型当裁判,分数漂亮上线打脸——裁判独立性是常识却总被忘。
- badcase 不归因就调 prompt,其实是检索没捞到——白调三天。