Skip to content

13 · 多模态输入

让 Agent 看得见

📚 系列导航:这是《Agent 开发进阶》的第 13 篇(共 24 篇)。上一篇把"什么时候必须问人"定了规矩,这一篇给 agent 开天眼——图片输入的成本账、三个高价值场景和工程处理套路。下一篇:14 · MCP

给模型发图片,demo 里两分钟就跑通了,你可能觉得这篇没什么可讲。但真接进 agent 流水线,问题立刻排队:账单为什么涨得比调用量还快?截图识别为什么时好时坏?发票场景的错字率为什么死活压不下去?这三笔学费我都交过,最贵的一笔是原图直传一周的账单。这一篇只干一件事:让你的 agent 用得起、也用得对图片输入。

看完这一篇,你会拿到:

  • 一个"先压缩再上传"的成本习惯,和分辨率选择的判据
  • 三个高价值场景的实现要点:UI 检查、单据识别、图表理解
  • 一条"图片进上下文还是先 OCR"的选择判据
  • 一条跑通的"截图→提表→入库"流程,5 张真实截图验收

01 成本模型:图片按分辨率吃 token

图片进上下文不是"一张图一个价",主流模型按分辨率(或切片数)折算 token——4K 原图直传,一张就能吃掉半个上下文窗口(各家计费规则不同,2026 上半年,以官方文档为准)。就像寄快递按体积计费:你要寄的是一张便签,却把它装进了冰箱的箱子。落地做法:先压缩到任务够用的分辨率——看整体布局 720p 足够,读正文 1080p 起步,抠小字才上高清;宁可低了再重传一次,也别默认原图。

多模态输入成本:原图直传与压缩后传输对比

💡 一句话总结:分辨率匹配任务而不是匹配原图,压缩是多模态的第一道成本闸。

02 三个高价值场景

UI 检查:把前端改动截图给 agent 验收,看布局错位、元素缺失——它看的是"对不对",不是像素级 diff,适合替代第一轮人工过目。单据识别:票据、表单转结构化数据,要点是给出目标 schema,并对金额、日期做程序校验,别裸信输出。图表理解:从报表图里读趋势和结论很稳,读精确小数不稳——我拿折线图提数值填周报,两位小数错了三处,从此精确数字一律回原始数据源取。

💡 一句话总结:三个场景都成立,但各有精度边界——理解找模型,精确对数找程序。

03 进上下文还是先 OCR

判据一句话:要理解,图进上下文;要抄写,先过专业 OCR。理解类任务(布局、语义、趋势、"这张图说明什么")是多模态的主场;抄写类任务(发票号、证件号这类识别率有硬指标的)用专业 OCR 做预处理,把结构化结果交给模型做校验和后处理。通用模型硬扛高精度 OCR,错字率大概率不达标——该用专业工具时别硬靠通用模型,两者串起来才是正解。

💡 一句话总结:理解用多模态、抄写用 OCR,串联使用而不是二选一。

04 动手:截图→提取表格→入库

任务:① 找 5 张带表格的真实截图(订单页、报表页都行),统一压缩到 1280 宽;② 让 agent 按给定 schema 提取表格并做字段校验;③ 通过校验的行写入数据库,失败的进人工复核队列。

python
# 伪代码:截图提表入库流水线
img = compress(load("shot.png"), max_side=1280)  # 先压缩
rows = llm_extract(img, schema=ORDER_SCHEMA)     # 按 schema 约束输出
ok, bad = validate(rows)                         # 金额/日期程序校验
db.insert("orders", ok); review_queue.push(bad)

预期输出:每张截图产出一批入库行加一份复核清单。

验收标准:一张字段级正确率表(5 张截图 × 各字段),外加压缩前后的 token 消耗对比——两组数字都拿到才算过。

两种结果都正常:正确率达标,固化这套分辨率和 schema 参数;错误集中在小字和数字,先提分辨率重测,仍不达标就按 03 节切 OCR 预处理——这说明你碰到了精度边界,不是你做错了。

05 小结

你现在应该能:按任务选分辨率并预估图片成本、判断一个场景该走多模态还是 OCR、跑通截图到数据库的完整提取流水线。

agent 有了手(代码执行)、有了规矩(审批)、有了眼睛(多模态),下一篇给它接上整个工具生态——14 · MCP:一个协议,N×M 变 N+M。


📎 实战案例

一位开发者 4K 原图直传跑了一周,单图吃掉半个上下文,账单教他做人。改成压缩到任务够用的分辨率后,图片端 token 成本降了一个量级;发票这类硬指标场景改用专业 OCR + 模型后处理,识别错误率也压进了验收线——成本和准确率同时稳住。

踩坑

  • 我原图直传跑了一周,账单让我连夜学会了压缩——一张 4K 图吃半个上下文,分辨率必须匹配任务。
  • 拿多模态硬做发票识别,错字率卡在验收线上方下不来,返工了两天——高精度抄写交给专业 OCR,模型只做校验和后处理。
  • 我让模型从折线图读精确数值填周报,两位小数错了三处——图表理解拿趋势可信,精确数字回原始数据源取。