Skip to content

11 · 检索策略

向量、关键词、混合与重排

📚 《AI 知识库开发入门》第 11/20 篇 · 下一篇:12 · Prompt 与引用溯源

语义检索有盲区:精确名词答不好。

检索策略:向量+关键词+重排

01 三类盲区

产品型号、人名、编号——问"XR-2100 保修期",纯向量可能捞回一堆"XR-3000"。语义相近不等于字面正确。

02 混合检索

向量(语义)+ 关键词(BM25 字面)双路召回再合并。含精确编号的场景必开混合,多数平台一个开关的事。

03 rerank 二段式

先粗捞 20 条,再用重排模型精选前 5——便宜的先筛、贵的后审,性价比极高。

04 top-k 调法

不是越大越好:k 过大,垃圾 chunk 挤占上下文反而答错。从小往上加,用评测集验证。

05 动手

开混合检索 + rerank 重跑评测集 → 验收:对比基线的分数变化表。

06 小结

检索优化是"找得全"与"找得准"的平衡。下一篇管住生成端的嘴。

📎 实战案例

用户问「XR-2100 的保修期」,纯向量检索捞回一堆「XR-3000」。团队开了混合检索(向量+关键词)+rerank 重排后,含精确编号的问题正确率立刻上去——语义相近不等于字面正确。

踩坑

  • 我的库被用户问编号类问题问崩过——开混合检索后该类正确率立刻上去。
  • top-k 调到 20 以为召回更全,评测分反跌——噪声也是要付费的。