Skip to content

14 · 评测进阶

从人工打分到自动化评测

📚 《AI 知识库开发入门》第 14/20 篇 · 下一篇:15 · 权限与安全

评测要从"项目"变成"习惯":每次改动跑回归。

01 LLM 当裁判

用另一个模型按标准答案给回答打分,规模化人工做不了的量。裁判要换家模型——同款模型自评自夸,分数虚高。

评测进阶:人工评测与LLM裁判对比

02 核心指标人话版

忠实度(答案是否忠于检索到的资料)、答案相关性(答没答到点上)、上下文相关性(捞回的资料对不对)、召回率(该捞的捞到没有)。RAGAS 类框架给了现成实现。

03 badcase 归因

流程图一句话:先看检索日志——没捞到是检索问题(回第 9-11 篇),捞到了答歪是生成问题(回第 12 篇)。

04 动手

把评测集升级为自动化跑分 → 验收:一键出分 + 每次改动的回归记录。

05 小结

自动化评测是质量的复利。下一篇上安全课。

📎 实战案例

团队用和生成同款的模型当评测裁判,分数漂亮、上线打脸。换家模型当裁判、并把 badcase 归因(先看检索日志再动 prompt)流程化后,评测第一次可信——裁判独立性是常识却总被忘。

踩坑

  • 我用同款模型当裁判,分数漂亮上线打脸——裁判独立性是常识却总被忘。
  • badcase 不归因就调 prompt,其实是检索没捞到——白调三天。