深色模式
11 · 检索策略
向量、关键词、混合与重排
📚 《AI 知识库开发入门》第 11/20 篇 · 下一篇:12 · Prompt 与引用溯源
语义检索有盲区:精确名词答不好。
01 三类盲区
产品型号、人名、编号——问"XR-2100 保修期",纯向量可能捞回一堆"XR-3000"。语义相近不等于字面正确。
02 混合检索
向量(语义)+ 关键词(BM25 字面)双路召回再合并。含精确编号的场景必开混合,多数平台一个开关的事。
03 rerank 二段式
先粗捞 20 条,再用重排模型精选前 5——便宜的先筛、贵的后审,性价比极高。
04 top-k 调法
不是越大越好:k 过大,垃圾 chunk 挤占上下文反而答错。从小往上加,用评测集验证。
05 动手
开混合检索 + rerank 重跑评测集 → 验收:对比基线的分数变化表。
06 小结
检索优化是"找得全"与"找得准"的平衡。下一篇管住生成端的嘴。
📎 实战案例
用户问「XR-2100 的保修期」,纯向量检索捞回一堆「XR-3000」。团队开了混合检索(向量+关键词)+rerank 重排后,含精确编号的问题正确率立刻上去——语义相近不等于字面正确。
踩坑
- 我的库被用户问编号类问题问崩过——开混合检索后该类正确率立刻上去。
- top-k 调到 20 以为召回更全,评测分反跌——噪声也是要付费的。