Skip to content

10 · Embedding 与向量库

给知识办"语义身份证"

📚 《AI 知识库开发入门》第 10/20 篇 · 下一篇:11 · 检索策略

embedding 决定"找得准不准",向量库决定"存得稳不稳"。

01 embedding 选型

三维度:中文效果、维度与存储成本、价格(各家规格随时效更新)。选型实验:两个模型建同库跑评测集,差距一目了然。

Embedding模型选型三维度:中文效果维度成本价格

02 换模型的代价

换 embedding = 全库重建——新旧向量不可混用。低成本试法:小样本库先测再决定。

03 向量库

万级文档用平台内置足够;十万级以上或多应用共享才考虑独立向量库(Chroma/Milvus/云托管)。过早上集群是给自己造运维债。

04 动手

两个 embedding 模型对比实验 → 验收:对比数据 + 选型结论。

05 小结

入门阶段"内置库 + 好 embedding"是最优解。下一篇优化找的策略。

📎 实战案例

有人中途换 embedding 模型没重建索引,新旧向量混存检索全乱。另一个团队过早上了 Milvus 集群,运维成本远超收益。入门阶段「内置向量库+好 embedding」是最优解——换模型=全库重建,换前想清楚。

踩坑

  • 我中途换 embedding 没重建索引,新旧向量混存检索全乱——重建是硬成本,换前想清楚。
  • 过早上了向量库集群,运维成本远超收益——规模不到别上重武器。