深色模式
09 · 分块 Chunking
切大切小,直接决定答得好坏
📚 《AI 知识库开发入门》第 9/20 篇 · 下一篇:10 · Embedding 与向量库
chunk 太大像借整馆(噪声多),太小像借碎纸片(上下文断)。
01 三种策略
按字数切(简单通用)、按语义切(段落边界)、按结构切(标题/条目)。规章制度类按条目切,长文按语义切——结构就是最好的切分线索。
02 大小权衡
小 chunk 检索准但上下文碎;大 chunk 上下文全但容易捞回噪声。没有万能值,只有场景值。重叠(overlap)缓解断句问题。
03 实验方法
同批文档两种策略建两个库,评测集各跑一遍,用数据说话——这是本课第一次"科学调参"。
04 动手
两种 chunk 策略对比实验 → 验收:数据化结论(不是感觉)。
05 小结
chunking 是 RAG 第一敏感参数。下一篇讲语义身份证:embedding。
📎 实战案例
默认 500 字切块把一条完整制度拦腰截断,AI 只答了前半条。团队对规章类文档改按「条目结构」切、用评测集对比两组参数后确定最优——chunk 大小没有万能值,只有场景值,要实验不要直觉。
踩坑
- 默认 500 字切块把一条制度拦腰截断,AI 只答前半条——条目类文档按结构切后此病根除。
- 我盲调 chunk 到 2000 字以为"上下文更全",检索准度反降——大小要实验不要直觉。