深色模式
10 · Embedding 与向量库
给知识办"语义身份证"
📚 《AI 知识库开发入门》第 10/20 篇 · 下一篇:11 · 检索策略
embedding 决定"找得准不准",向量库决定"存得稳不稳"。
01 embedding 选型
三维度:中文效果、维度与存储成本、价格(各家规格随时效更新)。选型实验:两个模型建同库跑评测集,差距一目了然。
02 换模型的代价
换 embedding = 全库重建——新旧向量不可混用。低成本试法:小样本库先测再决定。
03 向量库
万级文档用平台内置足够;十万级以上或多应用共享才考虑独立向量库(Chroma/Milvus/云托管)。过早上集群是给自己造运维债。
04 动手
两个 embedding 模型对比实验 → 验收:对比数据 + 选型结论。
05 小结
入门阶段"内置库 + 好 embedding"是最优解。下一篇优化找的策略。
📎 实战案例
有人中途换 embedding 模型没重建索引,新旧向量混存检索全乱。另一个团队过早上了 Milvus 集群,运维成本远超收益。入门阶段「内置向量库+好 embedding」是最优解——换模型=全库重建,换前想清楚。
踩坑
- 我中途换 embedding 没重建索引,新旧向量混存检索全乱——重建是硬成本,换前想清楚。
- 过早上了向量库集群,运维成本远超收益——规模不到别上重武器。