深色模式
07 · 效果体检
建立你的第一份评测问题集
📚 《AI 知识库开发入门》第 7/20 篇 · 下一篇:08 · 文档解析
没有评测集,一切优化都是"感觉好了"。
01 攒题原则
真实用户问题 > 自己拍脑袋。20-50 题起步,每题带标准答案与出处。
02 四类题
事实型(查一个值)、汇总型(跨文档归纳)、推理型(组合判断)、拒答型(库里没有、该老实说不知道)。四类都要有——上线后死得最惨的往往是只测了事实型的库。
03 打分标准
答对/答错/该答没答/不该答乱答,四格记账。跑出首次基线分,此后每次改动都对照它。
04 动手
建 20 题评测集并跑基线 → 验收:分类打分表(全课的对照组)。
05 小结
基线在手,后面每篇的优化才有意义。下一段进核心技术六件套。
📎 实战案例
工程师没建评测集就调了一周参数,「感觉好了」上线又被骂。他补了 20 题评测集(含事实/汇总/推理/拒答四类),跑出基线分——此后每次改动都对照它,优化第一次有了地面。
踩坑
- 我调了一周参数"感觉好了",上线被骂——回头建评测集才发现优化是负的。
- 评测集全是简单事实题,上线后死在汇总题上——四类缺一不可。