Skip to content

08 · 文档解析

PDF、表格、图片里的知识怎么掏出来

📚 《AI 知识库开发入门》第 8/20 篇 · 下一篇:09 · 分块 Chunking

解析难度金字塔:文本 < 单栏 PDF < 多栏 PDF < 表格 < 扫描件 < 图文混排。

01 PDF 三型

文本型(直接抽)、扫描型(走 OCR)、混合型(分页判别)。判别方法:能否选中复制文字。

文档解析PDF三种类型:文本型扫描型混合型

02 表格两条路

转 Markdown 表(保结构,适合简单表)或转一问一答(适合被高频查询的关键表)。涉及数字的关键表格建议问答化——行列错位是数字灾难的头号来源。

03 图片与图表

多模态解析在进步但有边界:流程图、架构图建议人工补文字说明后入库。

04 动手

解析一份含表格的 PDF 并验证表格问答 → 验收:表内数字能被正确问出。

05 小结

解析结果必须抽查原文比对——解析器不会告诉你它错了。下一篇讲切块。

📎 实战案例

多栏 PDF 被按行横读,两栏内容拼成乱话,抽查才发现。财务表转纯文本后行列全丢、数字张冠李戴。团队改成关键表格问答化、解析后必抽查原文比对——解析器不会告诉你它错了。

踩坑

  • 多栏 PDF 被按行横读,两栏拼成乱话,我抽查才发现——解析后抽查是必须动作。
  • 财务表转纯文本后行列对应全丢,AI 答的数字张冠李戴——那次之后关键表格一律问答化。