深色模式
08 · 文档解析
PDF、表格、图片里的知识怎么掏出来
📚 《AI 知识库开发入门》第 8/20 篇 · 下一篇:09 · 分块 Chunking
解析难度金字塔:文本 < 单栏 PDF < 多栏 PDF < 表格 < 扫描件 < 图文混排。
01 PDF 三型
文本型(直接抽)、扫描型(走 OCR)、混合型(分页判别)。判别方法:能否选中复制文字。
02 表格两条路
转 Markdown 表(保结构,适合简单表)或转一问一答(适合被高频查询的关键表)。涉及数字的关键表格建议问答化——行列错位是数字灾难的头号来源。
03 图片与图表
多模态解析在进步但有边界:流程图、架构图建议人工补文字说明后入库。
04 动手
解析一份含表格的 PDF 并验证表格问答 → 验收:表内数字能被正确问出。
05 小结
解析结果必须抽查原文比对——解析器不会告诉你它错了。下一篇讲切块。
📎 实战案例
多栏 PDF 被按行横读,两栏内容拼成乱话,抽查才发现。财务表转纯文本后行列全丢、数字张冠李戴。团队改成关键表格问答化、解析后必抽查原文比对——解析器不会告诉你它错了。
踩坑
- 多栏 PDF 被按行横读,两栏拼成乱话,我抽查才发现——解析后抽查是必须动作。
- 财务表转纯文本后行列对应全丢,AI 答的数字张冠李戴——那次之后关键表格一律问答化。