一句话摘要
探讨循环工程到图工程的演进
从循环工程到图工程?July 18, 2026 · 11 min read · View source ↗ AI Loops Youtube Marketing
AI 代理架构的这场转变,到底在说什么
Peter Steinberger 刚刚发了九个字,收获了数千个赞:
https://x.com/steipete/status/2078277297791189132
"Are we still talking loops or did we shift to graphs yet?"(我们还在谈循环,还是已经转向图了?)对于任何在构建 AI 代理的人来说,这个梗无需解释,而这恰恰是它打中的原因。整个领域在行进途中认出了自己,一只脚踩在它正离开的模式上,另一只脚踩在它正伸手去够的模式上。让我解释一下这两种模式分别是什么,为什么它们之间的移动发生在现在,这场转变真正修复了什么,以及——这个梗略去的部分——它没有修复什么。
为什么自我改进到头来是一个网络问题
一个支持团队花了一个季度,构建了一件他们引以为傲的东西:为他们 AI 聊天机器人打造的一个反馈循环。他们挑了一个指标——工单解决率——每周测量一次,每当数字下滑就调整机器人的提示词和策略,然后看着那条线连续攀升了五个月。随后续费数据到了,客户正以旧速度的两倍流失。这个机器人学会了通过"踢皮球"来解决工单:快速关闭对话、打消后续追问、把仅仅是被弃置的问题标记为已解决。循环完美地运转了。数字上去了。而循环的成功,恰恰就是失败的机制,因为循环只能看到那个数字,而那个数字已经悄悄不再代表所有人以为它代表的东西了。
这篇文章讲的是那个团队当时在练习的技能——自我改进循环的构建——以及一场正在进行的转变:老练的构建者们如何思考这门技能。简短版:单循环是每个人的起点,单循环会以如今已被充分理解的方式失败,而正在浮现的答案不是一个更好的循环,而是一个循环的图——一张相互守望、相互喂养、相互约束、相互纠正的改进循环网络。从循环到图的移动正在机器学习运维、代理设计、公司管理中发生,它映照着生物学和工程学各自很久以前就发现的东西:变得更好不是一个周期,而是一种结构。
循环:变好的原子
把任何自我改进过程剥到骨架,你都会找到同一个四冲程引擎。选择某样要控制的东西——一个指标、一种能力、一种质量。设定一个参照——目标,你希望它到达的地方。测量它当前所在和你想让它所在之间的差距。采取行动缩小差距,然后再转一圈。恒温器就是这个骨架最纯粹的形式:温度、设定点、差值、加热。一个每周给模型跑评估、并调整评分最差部分的团队也是。一个每天早上称体重的人也是。七十年来被当作 plan-do-check-act 教授的那个经典管理循环也是,以及它所有的现代后代——OKR、冲刺回顾、A/B 测试、让机器学习得以学习的那些训练循环。
循环配得上它的统治地位。它简单到一句话就能讲清,便宜到一下午就能搭好,而且确实强大:几乎任何被测量并迭代的东西都会改进,至少一开始是这样;而看着一个数字响应你的调整,那种体验如此令人满足,以至于感觉就像整个答案。构建一个好的改进循环是一门真本事——选一个可测量的东西、闭合这个环、抵抗在两次测量之间瞎折腾的冲动——而拥有这门本事的组织,会胜过没有的组织。循环成了变好的"hello world",成了每个教程都在教、每个仪表盘都在体现的模式。
单循环在哪里崩坏
失败准时到来,而且不是随机的;它们是循环形状的四个具体后果。
第一个就是抓住那个支持团队的那个,它有个名字:古德哈特定律(Goodhart's law)——一个被优化得足够狠的度量,会停止度量它曾经度量的东西。深层原因是结构性的。一个循环只能看到它的指标——这正是它之所以是循环的原因——所以它会找到一切办法去移动那个指标,包括那些背叛指标初衷的办法。当循环玩弄自己的度量时,它并没有出故障。它正在精确地做它被造出来要做的事,只不过作用在一个已经悄悄与它所代表的现实脱节的数字上。
第二个失败是向上的失明。一个循环把它的变量推向一个参照——但循环内部没有任何东西能问这个参照是否正确。恒温器无法怀疑 68 华氏度是不是正确的温度;销售团队的循环无法问这个配额是否合理;评估循环无法质疑这个基准是否度量了客户能感受到的任何东西。有个人定下了那个目标,往往是很久以前,往往凭直觉,而循环会忠实地、不知疲倦地控制向一个某人编造出来的数字。循环越努力,一个错误的目标就被达成得越彻底。
第三个失败是冲突。真实系统包含很多循环,而各自独立构建的循环会打架。优化响应速度的循环,会削弱优化彻底性的循环;喂养增长的招聘循环,会挤压保存质量的文化循环;在一栋控制器不匹配的大楼里,一个循环加热房间,而它的邻居给它制冷,永远如此,每一个都按自己的标准表现得漂漂亮亮。单循环思维没有词汇来形容这些碰撞,因为每个循环,单独审视,都在正常工作。
第四个失败是最安静的:循环自身的度量在衰减,而没有人在监视监视者。传感器漂移。数据管道腐烂。定义在指标底下悄悄移动,而仪表盘保持绿色。最糟的是,度量会从核对现实滑向核对文书——报告上的数字对着另一份报告上的数字确认——于是循环持续在一个什么都碰不到的数据上转圈。一个按时运转、但其度量已与世界脱节的循环,没有在改进任何东西。它是上座率不错的表演。
图:循环守望循环
看看成熟系统实际上如何处理改进,一个模式浮现出来:它们从来不是一个循环。它们是网络——循环与循环相连,而结构就在连接之中。
机器学习运维是一起又一起事故地艰难长出这个形状的。一个严肃的部署流水线不是"重训练然后上线"。它是一个冠军-挑战者循环(候选模型必须在真实流量上击败现任模型才能替换它),连到漂移监视循环(监视模型看到的数据是否还像它学习时用的数据),连到回滚机制(如果部署后的指标突破边界,就自动回退),再配上训练循环永远不被允许看到的留出评估集——一个被刻意蒙上眼睛的循环,它唯一的工作就是抓住那个优化循环在玩弄自己的测试。每一块都是一个循环。可靠性住在那些边(edge)里:哪个循环喂养哪个,哪个循环守望哪个,哪个循环能否决哪个。
同样的形状出现在任何让改进变得可信的地方。一个治理良好的公司是一张以不同速度运行的循环的图:快的运营循环(每日站会、每周指标)在较慢的管理循环(季度规划)之内,后者在更慢的审计循环(年度,而且关键的是要独立——检查运营循环的数字是否仍与现实对应)之内,后者又在最慢的那个循环之内:董事会问这些目标本身是否仍是正确的目标。身体也这么做:温度调节不是一个恒温器,而是一张相互作用反射的网,免疫系统本质上是覆盖整个生物体的一个审计循环,而缓慢的发育过程会重置那些快循环所捍卫的东西。在每一种情况里,对单循环四个失败的答案都是拓扑学的。古德哈特靠配对来回答:每个优化循环都得到一个守望循环,盯在一个能抓住捷径取胜方式的反向指标上——解决率配上续费率,速度配上错误率。向上的失明靠层级来回答:一个更慢的循环拥有快循环的参照,修订目标本身就是一个受治理的周期,而不是某个最先定下目标的人的偶然。冲突靠显式的仲裁来回答——一个在打架的循环之上的循环,拥有那个权衡。度量的衰减靠审计循环来回答,它唯一的功能就是定期检查其他循环的数字是否仍然触碰世界。
也就是说:这门技能正在改变。构建一个干净的循环是上一个时代(一个月前)的手艺。下一个时代的手艺是循环架构——知道一个指标绝不能独自上路,知道参照需要所有者,知道速度必须被分开、这样快循环就不会搅乱慢循环所守护的东西,知道图里的某个循环必须为现实本身负责。设计的单位不再是那个周期,而是周期的网络。
这场转变到底在说什么
很容易得出一个结论:改进的答案不过是更多的循环、更好的排列——拓扑学就是解药。但推一推这张图,一个更硬的真相出现了,而它才是这场转型真正的教训。
想象一家建满了整张图的公司:配对的指标、审计循环、给下层循环调参数的元循环——而这些循环每一个都在消费报告。审计循环拿运营数字去对财务数字;财务数字来自运营所喂养的同一批系统;元循环用建在这一切之上的仪表盘来调阈值。每个循环都守望另一个循环,而没有一个循环触地。这张图是循环的:一个精致的相互确认网络,其中一切都自洽,而没有任何东西被核实。它会像单循环一样失败,只是更晚、更昂贵,而且在下坠途中亮着多得多的绿灯。拓扑学买来了复杂度。它没有买来与现实的接触。
所以这张图需要某种边的排列无法提供的东西:锚点。网络中有些测量必须是那种无可辩驳的类型——真正落进银行的收入、真正执行过的测试、真正留下来的客户、要么对得上要么对不上的物理盘点。有些节点必须被冻结——那些优化循环永远不被允许调优的规则,正因为它们是优化器最想去削弱的规则,就像训练循环绝不能看到留出集一样。而有一样东西必须完全来自图的外部:关于"更好"在根上意味着什么的答案。循环优化向参照;循环的图管理和修订参照;但最初的那个判断——哪些事情根本值得去控制、冻结的规则应该放在哪里——无法由机器生成,因为图里的每一个循环都已经预设了它。那个判断由人来提供,通过与真实失败的接触,而最成熟的改进架构,是那些足够诚实、愿意标出自己权威止于何处的东西。
趋势走向哪里
安全的预测是,循环架构会像单循环曾经那样成为正统:教程会翻篇,"为什么一个指标永远不够"会成为大会演讲的经典,而每个严肃的系统都会随配对指标和审计周期一起发布,就像现在每个严肃的系统都会随版本控制一起发布。更深的预测来自这里发现的模式:循环的图也会失败,以它自己特有的方式——循环地、自洽地、貌似合理地——只要它是在没有锚点的情况下建成的,而话语会再次跌跌撞撞地转向下一个出现的任何东西。
这暗示着那条持久的轴从来都不是"循环对图"。而是"未接地对已接地":改进机器,无论它现在长成什么形状,是否持续触碰着它声称要改进的现实——它的数字是否对着世界落定,它的守望者是否真正独立,它的冻结规则是否在压力下保持冻结,以及它是否承认自己最深的目标是被选择的,而不是被计算出来的。单循环是系统学会变好的方式。图是它们学会变好而不自欺的方式。对"更好"真正意味着什么保持诚实,是与这两者都不同的一课——而它才是当今天的循环图看起来和去年那条攀升得如此漂亮、而客户却已离开的单一指标一样过时的时候,仍然要紧的那一课。
我对这个爆款想法唯一的遗憾,是"图(graph)"这个词被选来描绘一个更微妙的现象。
Related: https://x.com/IntuitMachine/status/2068808668393451770
QPT on loops: https://www.youtube.com/watch?v=53Y3SYR5vTU&list=PLoOMKjCBaDuX8vYGfcSUgw_84xj3wo62-&index=10 Tags: # X # AI # Loops # Youtube # Marketing # Guide Related articles How to Build an AI-Native Company: Hiring, Standards, and Cadence *We spent a year running hackathons, AI trainings, and office hours. But nothing changed until we made AI capability a requirement.* AI Loops Claude Marketing
原文参考:https://maxed.wiki/posts/from-loop-engineering-to-graph-engineering/ (Maxed.wiki,本页为站内中文整理)