Skip to content

01 · 进阶自查

你的"Agent"可能只是个带工具的 prompt

📚 系列导航:这是《Agent 开发进阶》的第 1 篇(共 24 篇)。这门课要带你从"会调 API、跑过 demo"走到"能交付一个可评测、可运维的 Agent",这一篇先给你一面镜子:照清自己现在到底站在哪一级。下一篇:02 · Workflow 还是 Agent

版本时效:本课涉及的 SDK/框架(Claude Agent SDK、OpenAI Agents SDK、LangGraph、MCP)API 演进快,示例基于 2026 上半年官方文档;以各家官方最新为准。

你大概率已经跑通过一个 agent demo:接了几个工具,演示时像模像样,群里发视频收获一片"牛"。但你心里可能也犯嘀咕——这东西敢不敢给真实用户用?我当年就是这个状态:demo 演示 10 次挑最好的 1 次给老板看,上线后真实成功率 40%,当场社死。demo 与产品的差距,不在功能在工程。这一篇只干一件事:用一套自查体系,帮你诚实地量出这个差距。

看完这一篇,你会拿到:

  • 一个成熟度定级结果:你的项目落在 L1–L4 哪一级
  • 一张 12 问自查表,每一问都指向本课的一篇解法
  • 一份按短板排序的主攻篇目清单
  • 一个从今天开始记录成功率的最小习惯

01 成熟度四级:从"能跑"到"无人值守"

先给标尺。L1 能跑 demo:理想输入下能出结果。L2 能处理边界:报错、重试、超时都有交代。L3 能被评测:有测试集、有成功率数字。L4 能无人值守:护栏、观测、熔断齐备,出了事能自己兜住或体面求助。

Agent开发成熟度四级:能跑demo到无人值守

打个比方,这就像学车:L1 是在驾校场地里绕桩,L2 是应付得了突然窜出的电瓶车,L3 是有教练拿秒表打分,L4 才是独自上高速。多数项目卡在 L1 到 L2 之间——不是能力不够,是没人给过标尺。落地做法:现在凭直觉给自己预定一级,读完下一节再校对。

💡 一句话总结:L1 到 L4 不是功能多少的差距,是工程完备度的差距——先认标尺,再谈进阶。

02 自查 12 问:每一问都是一篇课

逐条回答,答不上来就算"否":

问题对应篇
1 成功率测过吗(有数字)?19 评测
2 工具报错时循环会怎样?04 循环
3 每个工具的调用正确率测过吗?05 工具设计
4 system prompt 有分层结构吗?06 上下文
5 输出能被程序稳定解析吗?07 结构化输出
6 多步任务会先出计划吗?08 规划
7 跨会话记得住用户偏好吗?09 记忆
8 高危操作有人工审批吗?12 人机协作
9 防过 prompt 注入攻击吗?21 安全
10 跑一次任务多少钱?22 成本
11 出问题能定位到哪一轮吗?20 可观测
12 该不该拆多 agent 有判据吗?15 多 Agent

"否"超过 8 个是 L1,4–8 个大致 L2,少于 4 个且第 1 问为"是"才够 L3。这张表同时就是你的本课路线图。

💡 一句话总结:12 问就是 12 个工程缺口——你的"否"在哪,主攻方向就在哪。

03 诚实第一课:先量化成功率,再谈一切

进阶最难的不是技术,是心态。demo 文化的惯性是"挑最好的一次展示",产品文化的起点是"统计最差情况的概率"。我那次 40% 成功率的社死之后学乖了:任何功能上线前,先拿 20 条真实输入连跑,记下成功几次——粗糙,但比"感觉挺稳"诚实一百倍。就像减肥先上秤,数字难看也得看。另一个虚荣陷阱是拿"接了 20 个工具"当能力指标——工具数量是虚荣指标,调用正确率才是真的。

💡 一句话总结:先有成功率数字,再有一切优化——没量过的系统,谈不上改进。

04 动手:给你的项目跑一遍 12 问

任务:拿你现有的 agent 项目(没有就用你最想做的那个构想),逐条回答 12 问,只许答"是/否/不知道"("不知道"记为"否")。数出"否"的个数定级,再把"否"对应的篇目按痛感排序,取前三作为主攻清单。

验收标准:一页纸,含三样东西——定级结果(L 几)、12 问逐条答案、主攻篇目前三名。

两种结果都正常:定级 L1 别沮丧,这门课就是为你设计的,按 04–07 顺序打地基;定级 L2 以上,恭喜,可以跳读,直接扑向主攻清单那三篇。

05 小结

你现在应该能:说出成熟度四级的判定标准、给自己的项目定级、拿出一份有排序的主攻篇目清单。

进阶 = 把"演示品"变"工业品"。但在写代码之前,还有个最贵的误区要先拆:很多人的问题不是 agent 写得不好,而是根本不该用 agent。下一篇 02 · Workflow 还是 Agent,先把架构观扶正。


📎 实战案例

开发者演示时挑 10 次里最好的一次给老板看,上线后真实成功率 40% 直接社死。他跑完 12 问自查,"否"占了 9 个、定级 L1 后才承认:问题不在功能,在没测过成功率。按主攻清单先补评测和工具设计,两个月后成功率提到 78%——进阶的第一课是诚实面对数字。

踩坑

  • 我的第一个 agent 演示 10 次挑 1 次给老板看——上线首周被真实流量打回原形,成功率 40%。
  • 把"接了 20 个工具"当能力指标,一个工具的调用正确率都没测过——数量是虚荣指标。
  • 自查时给自己放水,把"大概能处理"答成"是"——三个月后照样返工,比当初诚实答"否"多花一倍时间。