深色模式
18 · Agent 团队实战
跑一个真实的多角色协作
📚 系列导航:这是《Agent 开发进阶》的第 18 篇(共 24 篇)。上一篇把移交和通信打通了,零件齐了;这一篇合练——调研、写 PRD、评审三角色跑一条真实流水线,把 15–17 篇的判据、简报、交接全用上。下一篇:19 · 评测 Evals。
前三篇讲的都是零件:何时拆、怎么派活、怎么交接不丢信息。但零件摆一桌不等于会装机。这一篇真刀真枪跑一个团队:给一个产品想法,产出一份 PRD——调研员查事实、撰写者写文档、评审员挑毛病。听着简单,我第一次跑就翻车:评审员和撰写者共用一套 prompt 基底,评审从头到尾点赞,一个问题没拦住。这一篇只干一件事:把三角色流水线从角色设计到 trace 复盘完整跑通,并用单 agent 版本做对照。
看完这一篇,你会拿到:
- 三个角色的职责边界与立场差异设计要点
- 流水线 vs 辩论式的选择判据(附轮数熔断值)
- 可直接抄的质量门规则(交接验收标准)
- 三角色 PRD 与单 agent PRD 的对比结论
01 角色设计:职责边界 + 真实立场差异
三个角色:调研员只产出事实与引用,禁止给方案;撰写者按模板出 PRD,只准用调研员给的事实;评审员按 checklist 挑毛病,只提问题不改稿。
关键在评审员:它的 prompt 必须和撰写者有真实立场差异。好比工地监理——要是和施工队同一个老板发工资,验收单上就全是"合格"。落地做法:评审员 prompt 写明"绩效由发现的真问题数衡量,放过问题是失职",再配具体 checklist:目标可衡量吗?验收标准可测吗?边界写了吗?
💡 一句话总结:角色的价值在边界和立场——没有立场差异的评审,只是多花一份 token 的复读机。
02 流水线还是辩论式
流水线(调研→撰写→评审→修订)适合产出型任务:目标明确、工序清晰。辩论式(多轮互驳后收敛)适合决策型任务:方案取舍、风险评估,需要立场碰撞。写 PRD 是产出型,选流水线。若选辩论式,铁律一条:设最大轮数。两个礼貌的 agent 能"您说得对,不过……"地互相谦让 15 轮不收敛。我的经验值:3 轮内强制收敛,由裁决角色拍板。
💡 一句话总结:产出型用流水线、决策型用辩论——辩论必须带轮数熔断,礼貌也要有预算。
03 质量门:不合格就打回
流水线最大的风险是垃圾顺流而下:调研缺引用→PRD 引用空气→评审对着空气提意见。解法是在每道交接设质量门——机器可判的验收标准(伪代码):
python
def gate(stage, doc):
if stage == "调研" and not doc.citations:
return "打回:无引用来源"
if stage == "PRD" and "验收标准" not in doc.text:
return "打回:缺验收标准"
return "放行"预期输出:不合格产物打回原角色重做,附理由。门的标准必须可判定——"写得不够好"不是标准,"缺引用"才是。
💡 一句话总结:每道交接设一道可判定的门——门不设,最后一环收到的就是层层放行的垃圾。
04 全程 tracing:复盘时你会感谢它
三角色跑起来后消息在角色间流转,出了问题——比如 PRD 冒出一条调研里没有的"事实"——靠记忆追不回来。从第一次运行就记全程:每条消息的发送方、接收方、内容、时间戳,落成 trace。复盘三问:哪一环丢了信息?哪一环加了没根据的信息?哪一环空转?
💡 一句话总结:先有 trace 再谈复盘——多 agent 的 bug 从来不在最终产物里,在流转过程里。
05 动手:三角色流水线 vs 单 agent,PRD 对比
任务:选一个真实产品想法。先用单 agent 一把出 PRD 存档;再跑三角色流水线:调研员出带引用的事实清单→质量门→撰写者出 PRD→质量门→评审员出问题清单→撰写者修订,全程记 trace。
验收标准:两份 PRD 对比三个数——事实引用数、可测验收标准条数、被评审拦下的问题数;评审员至少拦下一个真问题。
两种结果都正常:三角色版明显更扎实——专业化与制衡生效了,把角色 prompt 和质量门固化成模板;若两版差不多甚至单 agent 更好——通常是任务复杂度不够或评审立场没差异,这恰好验证第 15 篇判据:这个场景可能本不该拆,也是有价值的结论。
06 小结
你现在应该能:设计有真实立场差异的角色、按任务类型选流水线或辩论、在交接处设可判定的质量门、用 trace 复盘一次协作。
下一篇 19 · 评测 Evals:进入生产化四件套的第一件——"感觉变好了"不算数,评测才算数。
📎 实战案例
一个团队的评审和写作角色共用 prompt 基底,评审全程点赞、零拦截。重写评审立场(按发现真问题计功)、辩论设 3 轮熔断后,同一任务评审拦下 4 个真问题,其中一个是缺失的核心验收标准。
踩坑
- 我的评审角色曾和撰写者共用 prompt 基底,跑了 5 轮全是好话零拦截——立场差异要写进人设,还要给"挑错计功"的激励。
- 没设轮数上限,两个 agent"您先请"了 15 轮,一分结论没产出——礼貌也要熔断,辩论 3 轮强制收敛。
- 我第一次跑流水线没记 trace,PRD 里冒出一条凭空的"用户数据",追了半天不知道哪个角色编的——从第一次运行就落 trace。