一句话摘要
标题主题:搭建 AI 循环 700 小时后总结的 7 条原则
我花了 700 多个小时搭建 AI 循环(AI Loops)。以下是我希望第一天就有人塞给我的 7 条原则。
2026 年 7 月 14 日 · 9 分钟阅读 · 查看原文 ↗ Claude AI Loops
Peter Steinberger 每个月都说一遍:你不应该再给编程 agent 写提示词了,你应该设计循环,让循环去给你的 agent 写提示词。在 Anthropic 负责 Claude Code 的 Boris Cherny 说得更直白:"我不再给 Claude 写提示词了。我有循环在运行,循环去给 Claude 写提示词。我的工作是写循环。"
大多数人读到这几句话,点点头,然后完全不知道它们在实践里意味着什么。文件里该放什么?第二遍迭代时什么会崩?为什么一个人的循环一夜之间能交付三个 pull request,而另一个人的循环烧掉 40 美元却什么也没产出?
这就是能真正在生产环境里活下来的循环背后的 7 条原则。第 7 条决定了你的循环是帮你赚钱,还是悄悄把你掏空,而它只有在前六条落地之后才会起作用。按顺序读。
1. 提示词让你自己变成了引擎
看看大多数人怎么用 AI:敲一个请求,等,读答案,发现错误,再敲。感觉像是 AI 在干活。其实不是。每一个下一步都由你决定,每一个结果都由你检查,每一次失败都由你从一条消息带到下一条消息。你才是引擎。AI 是你手里的工具,而工具自己什么都不会做。
循环把角色对调过来。你一次性定义目标,然后系统自己跑完整套循环:弄清楚需要做什么,规划这一步,干活,检查结果,把失败反馈回去,重复。你走开,工作还在继续。
提示词给模型的是指令。循环给模型的是一份工作:一个目标、一种判断工作是否完成的方法,以及一条规定什么时候该放弃的规则。下面所有内容,都是关于如何正确地构建这三样东西。
2. 没有关卡(gate),就没有循环
验证是循环的心脏,而它恰恰是所有人都会跳过的那部分。如果没有一个真正能拒绝坏结果的真检查,你拥有的就不是一个循环。你拥有的是一台 agent 在反复自我认同,而让模型给自己的作业打分,这个评分者非常慷慨。
关卡是任何能在你不在场时判工作不合格的东西:一个测试套件、一个类型检查器、一次构建、一个 linter、一条严格的评分标准、一个可衡量的条件。把能用的循环和昂贵的表演区分开来的规则是:
完成的条件:测试返回 0 且 lint 返回 0。
不是"看起来没问题"。不是"大多数都过了"。
完成是一个退出码,不是一种感觉。
如果你的设置里没有任何东西能自动说出"不,这失败了",那就别搭循环了,回头去写一条更好的提示词。
3. 大多数任务配不上一个循环
循环听起来很强大,所以人们什么都想用循环来跑。你就是这样造出那些整夜空转的机器的。只有当一项任务全部通过下面这四项检验时,循环才配得上它的搭建成本:
它是否至少每周重复一次?一次性任务用一条好提示词更快。
坏输出能否被自动拒绝?见第 2 条。如果每一份结果都得由一个人从零开始逐份检查,循环就什么都省不下来。
agent 能否端到端地行动?如果它每隔两分钟就需要你的许可或缺漏的上下文,那就是加了额外步骤的手工活。
"完成"是否客观?"测试通过"是客观的。"这篇文章感觉很好"不是。没有任何 agent 会在美这件事上交给你退出码 0。
"分诊失败的 CI 运行"四项全过。"更新依赖并验证没有东西被搞坏"通过。"让设计感觉更高级"在最后一项上失败,而且永远会失败。这类任务就保持手工,这没问题。差一项,就写提示词。四项全过,就搭循环。
4. 制造者永远不检查自己的作品
循环设计里价值最高的单一结构性技巧:产出工作的 agent,绝不能是验证它的那个 agent。
不是因为模型没用。而是因为自我审查很弱——在机器里是这样,在人身上也是这样。一个刚写完修复的模型,已经花掉了自己的推理在为它辩护。让它审查自己,它会找到办法让自己过关。这就是为什么新闻编辑部有没写这篇稿子的编辑,为什么银行把付款的发起和付款的审批分开。
有效的模式:一个制造者产出,一个检查者验证,而检查者只看到需求和结果,永远看不到实现,也永远看不到制造者的推理。附加的经济学好处:制造者可以用便宜快速的模型,检查者用强大严格的模型。你为判断付高价,而不是为打字付高价。
检查者规则:
你收到规范和测试输出。别的什么都没有。
你不读实现。
测试全绿且满足规范 -> 批准。
少任何一样 -> 带着失败清单拒绝。
你没有其他意见。
5. 记忆活在文件里,不活在模型里
每一次 agent 运行都是从一张白纸开始的。它不记得昨天自己试过这个一模一样的修复,而且那个修复没用。如果你放着不管,你的循环就会每个晚上都重复同一个错误,花着你的预算。
解药不花一分钱:一个纯文本文件,循环在每次运行开始时读取,在结束时重写。试过什么。什么通过了。什么失败了。什么还需要人来处理。以及最被低估的一节,经验教训:那些既不存在于代码里、也不存在于文档里的本地地雷。
# STATE.md
## 上次运行
- 交付了 3 个修复,升级了 2 个
## 不要重试
- 盲目重启 worker:失败了两次,根因在别处
## 经验
- e2e 结账测试需要在环境变量里有 webhook 密钥。没有就跳过。
- windows runner 在 powershell 上会卡住。用 bash。
模型会忘记。文件不会。一个没有外部状态的循环不是循环,它是一连串上班第一天的日子。
6. 每个循环都需要一根保险丝
坏循环不会崩溃。这正是它们危险的原因。普通脚本会响亮地报错失败;一个坏循环会自信地继续运行,把只做了一半的活宣布为完成,在同一个死胡同里反复重试,悄无声息地给你记账。
所以每一个认真的循环都带两个停止条件。一个成功停止:关卡通过,交付并退出。还有一个失败停止,也就是保险丝:最多 8 次迭代、每次运行有美元预算上限、同一个错误重复两次就停、检查者连续两轮拒绝同一个修复就停下并升级。工具已经支持这些了:Claude Code 有一个字面意义上的预算标志。第一天就设好它,而不是在收到第一张惊吓账单之后。
同样的逻辑还意味着:从封闭循环开始,而不是开放循环。"每周一,检查有没有安全的依赖更新,一次应用一个,跑测试,全绿就开一个 PR,红了就记录并停止"是封闭的:有界的路径、明确的检查、显式的退出。"找到改进产品的方法并实现最好的那些想法"是开放的:激动人心、探索性十足,也是一个烧 token 的熔炉。封闭循环很无聊,而无聊正是你可以在夜里放心托付的东西。逐步赢得自主权:先要可靠性,后要自由。
7. 唯一的指标是:每个被接受的结果的成本
不是花了多少 token。不是跑了多少个循环。不是"看,我睡觉的时候它干了点活"。决定一切的那个数字是:每一个你真正保留下来的结果,到底花了你多少钱?
循环的成本复利方式,是单个提示词永远不会有的。每一次迭代都要重读目标、状态、之前的失败、工具输出。这堆东西每一轮都在变大。一个跑十次的循环不是十个提示词,而是十个一次比一次大的提示词。再加一个检查者 agent,你就把读者数量翻了一倍。
当循环能交付时,这笔花销没问题。当它不能交付时,它就是毒药。如果循环产出了十份输出,你拒绝了七份,它没有帮你省活,它制造了审查债务。如果它开了五个 PR 而你只合并了一个,手工反而更便宜。还有一种更安静的代价:当循环交付得比你阅读还快时,你对自己系统的理解就会落后。代码能跑,但没人知道为什么。那张账单晚点会到,还带利息。
这就是为什么构建顺序是固定的,而跳步正是循环在凌晨三点爆掉的原因:
1. 手工跑这个任务,直到一次运行是可靠的
2. 把指令存成一个可复用的 skill
3. 加上关卡(第 2 条)和检查者(第 4 条)
4. 加上状态(第 5 条)和保险丝(第 6 条)
5. 只有到这一步,才把它放到时间表上
今晚就试一下这个形态,不需要任何工具
你可以在任何一个聊天模型里,用一段粘贴就感受到整个模式。不需要调度器,不需要 agent,不需要账单:
你将在一个循环里工作,直到任务达标。
任务:[你确切想要的东西]
成功标准:
- [标准 1]
- [标准 2]
- [标准 3]
每一轮:
1. 规划 - 说出下一步的单一步骤
2. 执行 - 产出或改进工作
3. 验证 - 在每一条标准上残忍地打 1-10 分
4. 决定 - 全部 8 分以上?打印 FINAL 并停止。
否则打印 ITERATING,并先修复最弱的那一项。
规则:永远不要提前宣布完成。最多 3 次迭代。
假设而非提问。开始。
看着它起草、给自己打分、找到弱点、重写,然后才停下来。这就是整个想法在微缩尺度上的样子。它所缺的,正是这 7 条原则补上的东西:一个不是你自己的触发器,一个不是模型意见的关卡,一份能跨会话存活的记忆,以及一根保险丝。
重点
提示词工程改善一个答案。循环工程改善产出答案的过程,而复利就住在这个过程里。现在用 agent 赢的人,并不是在聊天框里写更聪明的提示词。他们是在决定:什么启动工作、什么验证工作、它绝不能碰什么、以及它什么时候必须停下来呼叫一个人类。
循环才是产品。提示词只是它的一部分。
在搭建任何东西之前,先收藏这篇。然后回复我:那个你每周都要重复、又在心里默默厌恶的任务是什么,我会用一条消息帮你画出它的循环。
标签:# X # Claude # AI # Loops
相关文章
《如何打造一家 AI 原生公司:招聘、标准与节奏》
*我们花了一年时间搞黑客松、AI 培训和答疑。但直到我们把 AI 能力变成一项硬性要求,一切才真正改变。* AI Loops Claude Marketing
原文参考:https://maxed.wiki/posts/i-spent-700-hours-building-ai-loops-here-are-the-7-principles-i-wish-someone-handed-me-on-day-one/ (Maxed.wiki,本页为站内中文整理)