一句话摘要
用图工程运营 AI 智能体团队
从循环到图:如何运营一支真正的 AI 智能体团队 2026 年 7 月 23 日 · 21 分钟阅读 · 查看原文 ↗ AI Claude SEO 内容
一个安静的早晨。没有打开的标签页,咖啡甚至还没倒。然而,一份关于你昨晚用一行字输入的提问的完整报告,已经摆在屏幕上了。
五个研究员连夜挖掘它,每人从一个不同角度,全部并行。第六个智能体逐条检查每一项发现并试图干掉它:这是不是编的,是不是过时的,来源到底存不存在。没能通过检查的,从来不会出现在报告里。通过了检查的,就在你眼前,按置信度排序,附上链接。
最后那句话由你说了算。你读它,并决定怎么做。你还没点过任何一个按钮。
这不是什么新魔法,也不是又一个持续一个月的炒作周期。它是一张图:一个关键系统已经跑了几十年的模式,只不过现在它指向的是一支 AI 智能体团队,而不是一条数据流水线。
在开始有趣的部分之前,先说一个直白的真相:图买到的是广度,而不是判断力。五个智能体找到的会多过一个,但它们推理得不会比一个好。把这两者搞混,你就会为一个本可以靠单个智能体完成的团队付钱。
几周前你也许第一次走出一个循环,让模型自己跑。而时间线已经宣布循环是昨日新闻,整个对话都转向了图。好消息是,这里没有任何你一个晚上搞不定的事,而且一行代码都不用写。
这篇内容覆盖七件事:
图到底是什么,从地基讲起
菱形(diamond),那个真正值钱的模式
保护你账单的停止规则
你在这整件事里到底站在哪
三张你今天就能粘贴运行的现成图
如何用十分钟构建你的第一张图
每个人都踩的坑
在我们深入之前:我在 Telegram 频道里每天发关于 AI 和智能体的笔记,还有现成的提示词和拆解:https://t.me/shmidtai 。免费。
第一部分 · 图是什么,从地基讲起
1.1 图是一份为你工作画的计划
先把「图」这个词放一边,连同你在那些帖子里看到的一切。它核心回答两个问题:哪些任务需要发生,以及哪个任务必须等哪个。
一个任务,是你会交给一个助手的一件事:研究一个竞品,写一份草稿,核对一个说法。一个任务,一个节点。
当一个任务需要另一个任务的结果才能开始时,你用一根箭头把两者连起来。还有一小套随工作一起移动的运行笔记:发现了什么、决定了什么、还剩下什么。这就是全部词汇。节点、箭头、笔记。
上个月所有人都在谈论的循环,就是一个节点接回自己的图:做它,查它,没做完,再来。图是同一套思路,只不过现在有多个任务,而且其中一些能同时运行。
1.2 你一半的箭头是假的
这是今晚值得做的一个练习,在你打开任何新工具之前。
拿你当下运行的系统,对它里面的每一个「然后」,问一个问题:下一个任务真的需要上一个任务的结果吗?
「总结这个文件,然后查我的日历」听起来像一个序列。但日历那一步从来不需要总结,一秒都不需要。那两个任务本来就不必互相等待。它们之间的箭头是假的,而那段等待是纯粹的浪费。
只有当真有人工作真正流过一根箭头时,它才是真的。画出你自己的系统,你会发现任何系统里都有两三根假箭头。现在你的系统大概跑成一条直线,每个任务都等它前面那个。这能跑。而且这是跑事情最慢的方式,因为一个卡住的步骤会挡住它后面的一切。
一个快速检测假箭头的方法:用拇指盖住上一个任务。如果下一个任务仍然能开始,那它们之间就没有箭头,不管你的直觉怎么说。
一个简短词汇表,好让后面的内容读起来干净:
节点:一个智能体的一个任务。
箭头(边):「这个任务等那个。」只有当真有人工作流过它时才是真的。
状态:运行笔记,发现了什么、决定了什么,随工作一起移动。
扇出(Fan-out):一个任务分裂成几个并行运行的那一刻。
菱形(Diamond):「分裂、并行收集、检查、合并回来」这个形状。
门(Gate):流程撞上一个人、并等他点头的那一刻。
第二部分 · 菱形,那个值钱的模式
观察任何一个认真的智能体系统工作,同一张图会一再浮现。工作分裂。几个工人并排挖掘。某个东西检查他们找到的东西。然后一切合并回一个答案。
那张图叫菱形,而且我相当确信它是你今年唯一需要的模式。
这不是白板理论。Claude 里的 research 功能正是这么构建的:一个领队智能体做计划,工人们并行收集,每个在自己的独立上下文窗口里,还有一个独立的智能体在东西到达你之前核实来源。按 Anthropic 自己的测量,那支团队在他们内部的 research 评估上,比同一引擎上的单个智能体高出 90% 以上。
**-> 我们如何构建多智能体研究系统,Anthropic**
原因不是智能体更多了。原因是推理被分散到了几个独立的上下文窗口里,这是一种单个智能体在物理上无法达到的广度:它只有一个窗口,而且会模糊。
现在说那个所有人都划过去的部分。检查。把它当成模式的一部分,而不是可选项。
当研究人员直截了当地问模型它们自己推理链条里的错误在哪时,最好的模型也有 52.9% 的概率答对。那几乎不比抛硬币好。然而当错误被指出来时,模型能很好地修好它。结论很简单:模型在找自己的错误上几乎没用,在修别人指给它的错误上很在行。
**-> 大语言模型能识别并纠正自己的错误吗?,Google Research**
由此得出铁律:永远别让一个智能体给自己的作业打分。把检查交给一个独立的任务,它唯一的活儿就是在弱发现到达你之前干掉它们。而且给每一个检查者一个不同的问题。一个问它是否正确。一个问它是否是最新的。一个问来源到底存不存在。三个不同的问题抓住三种不同的缺陷;三个相同的问题只抓住一种。
检查者还有一条规则:它只读。给它写权限,它会悄悄修补一个弱发现,而不是拒绝它。这跟新闻编辑部里的文字编辑、以及付款上的第二个审批人是同一个逻辑:第二方可靠,不是因为更聪明,而是因为它不背着第一方的历史。
2.1 这个模式已经存在于什么里面
菱形不是你必须去发明的。它已经坐在你可能正在用的工具里:
Claude Code,子智能体。当提示词要求它分叉时(「workflow」这个词就是这样一个信号),它可以并行跑多个子智能体并合并它们的输出。这是起点,什么都不用额外安装。
Claude 里的 Research,就是那个领队智能体加并行工人加来源核实。一个生产环境里活着的菱形,还带着那个 +90% 的数字。
Anthropic 单独写的「orchestrator-workers」模式:一个协调器拆分任务,工人们做各自的部分,协调器合并。那就是换了种说法的菱形。
LangGraph 以及类似的框架,你显式地用代码写节点和边。当图变大、需要版本管理和复用时,再去找它们。
**-> 构建有效的智能体,Anthropic**
结论不是「再装一个框架」,恰恰相反:一个工具今天就能跑你的第一张图。你以后再加框架,而且只有当你能够说出你需要它的理由时才加。
第三部分 · 保护你账单的停止规则
智能体更多并不自动更好,而这是这门课真正帮你省钱的部分。
当一支智能体团队和一个单个智能体拿到同样的预算时,在能拆成独立部分的工作上,团队明显获胜;在每一步都依赖前一步的工作上,团队同样明显地落败。广度,图买得到。判断力,买不到。
那份广度带着一个价签,而且不小。Claude 里那支研究团队,燃烧的 token 大约是普通聊天的十五倍。十五倍。在真正能拆分的工作上,这值得。在一切都相连的工作上,你只是用十五倍的速度清空账户,去换一个单个智能体本可以用更少代价给出的答案。
一个在你启动任何东西之前跑的小选择器:
一次性任务 -> 一条犀利的提示词
经常重复,但步骤首尾相连 -> 一个智能体,或一个循环
经常重复且能拆成碎片 -> 一张图(菱形)
再谈单位经济,因为那个「15x」的数字毫无理由地把人吓到。如果答案背后是一个值几千块的决策(一个价格、一次招聘、一个市场),多出的 token 相比美元只是几分钱,而图在第一次运行就回本了。如果你在单个智能体用几分钱就能关掉的相关琐事上跑菱形,那你是在为一份平庸的答案付十五倍的价钱。图不贵。放错地方的图才贵。
由此得出停止规则,而且它很短。
在你加任何一个智能体之前,问那个决定账单大小的问题:我的工作在哪里分裂?在每一步都需要全貌的地方,就守着一个智能体。工作分裂成彼此从不读对方结果的碎片的那一刻,才是图开始回本的时候。不是之前。
这和循环的纪律完全一样。一个工具更强,不是它更复杂的地方,而是任务真正适合它的地方。
第四部分 · 你,最后一个节点
你是你自己图里最重要的节点,而这一部分讲的是你究竟该站在哪。
每一个严肃的系统,在任何无法撤销的事情之前,都会把流程导到一个人类那里。发送、发布、退款、发票,那些是应该止于你的箭头。你的批准,是一份在流水线上拼装出来的草稿与外部世界之间,最后的那一声「是」。
Klarna 是公开学到这一课的那一家。这家公司把 AI 客服铺到了相当于大约 700 个岗位上,然后承认向削减成本的倾斜损害了服务质量,并把人类作为 AI 之上的一层高级服务带了回来。它的 CEO Sebastian Siemiatkowski 说得很直白:过度强调削减成本,导致了更差的服务。
**-> Klarna 在 AI 上转向,说客户喜欢和真人对话,Forbes**
这条设计规则一行字就装得下:把你的批准放在「出错后撤销代价高昂」的地方,而不是每一步。处处设门会让你变成瓶颈。处处不设门意味着没人在看。
还有四条防止图变成昂贵事故的小规则:
图里的每一个循环都有一个它能跑多少轮的上限。
任何一个文件只允许一个任务写。两个写手写一个文件,注定损坏。
路由存在于写好的步骤里,AI 填的是任务。你定形状,模型做内容。
永远有一个能生成多少智能体的上限,这样图就不能无休止地繁殖它们。
而且要用不会说谎的数字来评判系统:落地的钱、留下的客户、通过的测试。一个只给自己报告打分的系统,是自信地错着。
第五部分 · 它运行起来长什么样
当图真正运转时,一次运行看起来是这样的。你看不到一堵文字墙,你看到一段短日志:
Split:问题拆成 5 个角度
Launch:5 个研究员并行
Gather:23 项发现,每项带链接和日期
Skeptic:9 项发现被干掉(无来源、过时)
Merge:14 个幸存者,按置信度排序
Pause:在保存报告前,等你的「是」
二十三项发现里九项没能通过检查。那就是产品。研究和传闻收集之间的区别,正是那一道 skeptic 检查。
如果你怀疑一支智能体团队是否认真、是否会留下来:Anthropic 的工程师用一支 16 个并行 Claude 的团队,构建了一个能用的 C 编译器,大约 10 万行 Rust。不是一个三函数玩具,是一个编译器。那就是这个模式今天已经承载的上限。
**-> 用一支并行 Claude 团队构建一个 C 编译器,Anthropic**
第六部分 · 三张能自己回本的图
下面每一个构建都在 Claude Code 里运行,以你粘贴的那条精确提示词结尾,并把你留作那个门。Claude Code 可以并行跑子智能体,而这条提示词就是让它这么做:几个研究员同时跑,加一个独立的检查者,而不是一行行步骤。单词「workflow」就是分叉的信号。
这些提示词保持原样;模型这样能读得更精确,而你也一行代码都不用写。
6.1 研究台(The Research Desk)
想想你最近一次背后有真钱的决策:一次调价、一个新报价、一个你差点进入的市场。你大概靠一周的谷歌搜索或一张昂贵的分析师发票来做了决定。这张图取代这两者。
你的问题拆成五个角度,五个研究员同时挖,一个 skeptic 攻击每一项发现,只有幸存者带着来源到达最终报告。
怎么运行:在一个空文件夹里打开 Claude Code,用一行写下你真实的问题,粘贴提示词,观察扇出和 skeptic 检查,读报告。只有通过你阅读的东西才会进入决策。
i need decision-grade research on: [your question]. use a workflow:
split the question into 5 distinct angles, run one researcher per
angle in parallel, every finding needs a source link and a date,
then run a skeptic against each finding that tries to disprove it,
drop what fails, merge the survivors into one report ranked by
confidence, save it as research-report.md and show me the top findings
第一次运行花几分钟而不是几天。skeptic 检查在这里才是真正的产品:它是研究和一堆漂亮传闻之间的区别。
提示:在末尾加一行,「list what you could not verify.」它没能确认的东西的清单,往往比发现本身更有价值,因为它告诉你哪里不能靠。
6.2 SEO 内容机器
老实面对你的发布节奏。对很多人来说,它要么每月花一笔月费,要么干脆停止了。这张图每次运行产出一份「可以拿去排名」的草稿,而且没有你它永远不发布。
三个研究员并肩工作:一个拆解当前排名靠前的页面覆盖了什么,一个收集人们对这个主题真正在问的问题,一个找出所有人都跳过的东西。他们的工作合并成一份大纲,从大纲写出一份草稿,草稿被事实核查,然后它就在你的文件夹里等你的「是」。
怎么运行:拿你客户会输入搜索的那一个主题,粘贴提示词,三个研究任务同时跑,草稿落进一个 drafts 文件夹,每个站不住脚的说法都被标记在顶部。你读它,修那些只有你才知道的东西,然后自己发布。之后让 Claude 保存这个工作流,于是每个周一它就从「一个下午」变成「一条命令」。
i want an article that can rank for: [topic]. use a workflow: run
three research jobs in parallel, one lists what the current
top-ranking pages cover, one collects the real questions people ask
about this topic, one finds what the top pages skip, merge all three
into an outline, write a full draft from the outline, then run a
fact-checker that flags every claim without a source, save the draft
to drafts/ with the flagged claims listed at the top, never publish
anything
提示:把 skeptic 和 fact-checker 作为带不同问题的独立节点。一个查事实,另一个查这篇文章有没有回答读者真正的问题。把它们熔成一个,你就丢掉了一半价值。
6.3 上市套件(The Go-to-Market Kit)
你在发布某样东西:一个产品、一个报价、一项服务。诚实的选项一直只有两个,几周的筹备,或盲发布。这张图一次运行产出完整套件,而且每一块都由你批准。
三个研究员并行描画买家、渠道和竞争。他们的工作合并成一页定位文档,系统就停在那里,好让你读它:那一页成为每个资产都要对标的根基。然后三个写手并行产出落地页文案、发布帖子和外联消息,一个检查者标出任何偏离定位的东西,套件落进一个文件夹,那里没有任何东西会自己发出去。
怎么运行:用各一行说出产品和它是给谁的。粘贴提示词。当系统暂停时读定位页——这是我绝不会跳过的一步。让三个写手产出资产,审查检查者标出的东西,逐块批准。
i'm launching [product] for [audience]. use a workflow: run three
research jobs in parallel, one profiles the buyer and collects the
exact words they use, one maps where these buyers spend time online,
one collects how competitors pitch them, merge into a one-page
positioning doc and pause to show it to me, then run three writers in
parallel from that doc: landing page copy, a week of launch posts, a
set of outreach messages, then run a checker that compares every
asset against the positioning doc and flags anything off, save
everything to launch-kit/ and change nothing after that without
asking me
定位文档上的那次暂停不是客套,它是一个门。你批准的那一页,一次性地为每一个资产定下声音。跳过它,三个写手就散成三个不同的品牌。
第七部分 · 用十分钟构建你的第一张图
你已经看过理论,现在上手。拿一个背后有真钱的问题,构建 6.1 的研究台。计时:
3 分钟 -> 写下问题,并说出挖它的 5 个角度
3 分钟 -> 粘贴带「workflow」这个词的提示词,启动扇出
2 分钟 -> 加一个 skeptic 节点,它的活儿是干掉没有来源的发现
2 分钟 -> 加门:在报告保存前,一次暂停和你的「是」
就这些。你有了一个能用的菱形,以及你时间线上几乎没人有的理解。从这里起只剩两步:保存这个工作流,让它变成一条命令;以及在你看到图哪里会瞎时,加角度或检查者。
第一张图的规则:让它丑。五个角度而不是完美七个,一个 skeptic 而不是三个。一张能跑的粗糙图,比一张纸面上的完美图教你更多。
第八部分 · 每个人都踩的坑
一张图会以可预测的方式坏掉。这里是五种坏法,按症状、成因、修法给出,好让你在它们变贵之前认出来。
文件变成了一团烂泥。成因:两个节点同时写它,互相竞争。修法:每个文件一个写手,其余只读。想从碎片拼装,就在末尾加一个专门的合并节点。
skeptic 对一切都放行。成因:你给了它和作者一样的问题,所以它用同样的方式思考。修法:给检查者一个不同的角度,「来源存在吗」「它是最新的吗」,而不是「这活干得好吗」。
账单触顶。成因:图对智能体或轮数没有上限,所以它繁殖了它们。修法:对智能体设硬上限,对每个循环设最大轮数,永远如此。
你成了瓶颈。成因:每一步都坐着一个门,所以图不断地等你。修法:只在出错后撤销代价高昂的地方设门,其余让它流。
你为一篇平庸答案付了 15x。成因:在相连的工作上做了扇出,每一步都需要上一步。修法:回到「工作在哪里分裂」,如果没有答案,就守着一个智能体。
贯穿五条的共同线索:一张图会用它跳过的规则所保护的那件东西,来惩罚你。纪律正是从这里来的。
第九部分 · 没人宣传的那部分
一张图改变工作的形状。它不把你从工作里移除。而随着图变好,有两件事会变糟,而不是变好。
没人提的成本。你买的广度花的是 token,而我们已经见过那个数字:大约是普通聊天的十五倍。一张指向相连工作——一切依赖一切——的图,是拿到一份平庸答案最贵的方式。
理解债增长得更快。一个循环交付了你没写的代码。一张图交付更多,而且更快,因为它是并行跑的。它转得越顺,发出去的东西和你真正读过的之间的鸿沟就越宽。
还有一个比它们加起来都贵的坑。跳过最后那声「是」,图就会把它的第一个自信的错误,直接发到客户手里。处处设门让你成为瓶颈。处处不设门,意味着第一个自信的失误,会以你的名义发到外面的世界。
结论不是打击人,只是现实:图是一个触达放大器,而不是判断力的替代品。用那些无法反驳的数字来评判它,并把手放在最后那道门上。
速查表
拿去直接用,不必重读其余部分:
先清假边。在你删掉那些没有工作流过的箭头之前,什么都不运行。
只拆分那些从不读彼此结果的工作。任何一步步的事都留在一个智能体上。
没有发现能不检查就通过,也没有两个检查者问同一个问题。
检查者只读,这样它就不能悄悄修补弱的东西。
图里的每个循环都有轮数上限,智能体数量也一样。
每个文件一个写手。路由活在写好的步骤里,AI 填任务。
最后那声「是」正好坐在「出错后撤销代价高昂」的地方。
一个工具就够了,直到你能说出它不够的理由。
构建一张图之前要问的三个问题:
我的工作实际上在哪里分裂成独立的部分?
这里有什么撤销代价高到应该止于我的东西?
这项发现,能挺过一个问着不同问题的独立 skeptic 吗?
拉远来看
循环是关于「谁来做工作」的一次转变。图是关于「多少工作同时跑」的一次转变。但所有这些与现实世界交汇的那个点,一寸都没动。它原封不动地留在了它一直在的地方,在你那里。
一张图不会让你更聪明。它让你更宽。它接走等待、并行、对弱东西的第一道粗筛,然后把整件事为之而建的那个座位还给你:手握全貌的最后一个决策。
循环把你从手动提示里解放出来。图把你从手动等待里解放出来。两者都没有把思考拿走,思考留在你这里。如果你只从这里带走一件事,就带走这个,然后今晚去画你自己的系统,数出假边,删掉它们。这什么都不花,而且通常比任何你买得到的工具都更能省掉等待。
如果这篇打动你了,收藏它并关注我,还会有更多现成的图、提示词和拆解:https://t.me/shmidtai
@shmidtqq 标签:# X # AI # Claude # SEO # 内容 # 帖子 # 指南 相关文章 如何精通图工程(完整课程) 我要向你展示如何构建你的第一个智能体图,并在今天把它用到你的生意里:一支并行研究、试图干掉自己发现、并交给你一份……的 AI 智能体团队。 AI Claude SEO 内容
原文参考:https://maxed.wiki/posts/from-loops-to-graphs-how-to-run-a-real-team-of-ai-agents/ (Maxed.wiki,本页为站内中文整理)