一句话摘要
构建一组 AI Agent 在无人值守时自动交付生产级代码。
如何构建一个 AI agent 集群,在你睡觉时交付生产代码
July 14, 2026 · 6 min read · View source ↗ AI
我将拆解如何构建一个 AI agent 集群,它替代了软件团队日常所做的大部分工作。
直接开始。
我以开发开发者工具和 agentic 系统为生。我关注的是,当 AI agent 触及真实生产流水线时它们会如何表现,而不是玩具 demo。私信开放,欢迎合作。
在我上一篇文章里,我说我会带一小批构建者走一遍他们的第一个 agentic 流水线设置。已经有几个人跟我走完了,其中一个现在正在跑一个完整的自我交付循环。
这个提议依然有效。如果你在构建类似的东西,回复或私信我你当前的设置,我会指出它与真正集群之间的差距。
大多数开发者仍然用十年前的方式交付代码。他们开一张工单。他们写函数。他们写测试。他们开一个 pull request。他们等。他们合并。他们盯着仪表盘。
他们自己就是那条流水线。
如今用 AI 构建的最有生产力的团队已经不再这样做了。他们改为构建集群。每个 agent 拥有一个阶段。各个阶段并行运行。版本在团队睡觉时发布。
一位在快速增长 AI 创业公司的工程负责人,不久前说得非常直白:
"我不再写代码了。现在我写的是写出代码的那个循环。"
这一句话,就是集群如此重要的原因。
交付软件本来就已经是一条流水线:规格、实现、测试、评审、部署、监控。每一个运转良好的工程组织都在跑这个序列。过去的唯一区别是,它需要十几个工程师坐在每个阶段里。现在不再需要了。
我花了过去几周搭建这个集群。它一夜之间读完工单。它起草实现计划。它写代码。它写并运行测试。它对着第二个模型评审自己的 diff。它开 PR,并在任何人类看它之前标记出任何有风险的地方。
到这篇文章结束时,你将了解一个五 agent 交付集群的架构、在一个周末搭建它的设置,以及破坏大多数首次尝试的三种失败模式。
我们开始。
第 1 部分:集群到底是什么
一个提示词问一次问题,然后停下。
一个循环持续工作,检查自己的进度,直到任务真正完成。
一个集群是多个并行运行的循环,每一个都是专家,每一个的输出喂给下一个。
这就是全部的心智模型。
第 2 部分:运行它的设置
用普通脚本手工搭这个,很快就会崩。当一个 agent 需要等另一个 agent 时,它崩了。当你的状态需要跨周期持久化时,它崩了。当你想让五个循环在五个不同的模型上并行运行时,它崩了。
你真正需要的,是一个编排层,它能够:
把一个任务扇出到专业化的循环
把任意模型指派给任意步骤
在运行之间保持状态
持续运行,直到一个真实、可检查的条件被满足
第 1 步:安装 CLI
第 2 步:连接你的模型
对于规格编写、实现和测试这类样板步骤,用一个又快又便宜的模型;评审步骤用一个更强的推理模型。
第 3 步:起草循环
用大白话告诉 CLI 你想要什么:
draft me a program that runs five agents in sequence: spec writer, implementer, tester, reviewer, deployer. run it every time a new ticket lands. use the fast model for the first three agents and the strong model for review.
下面大概就是最终循环的样子:
这就是整个集群。一个文件。五个 agent。永远运行。
第 3 部分:五个 agent
每一个严肃的工程组织都跑同样的五个交付阶段。下面就是替代它们的集群。
创作者从不评审创作者自己的工作。Reviewer 永远运行在一个与写出代码不同的、更强的模型上。
第 4 部分:它如何替代一个团队
过夜交付。集群在团队睡觉时消化积压任务。每天早上,都有已经实现、测试、评审过的 pull request 等在那里,等待的是一个人类的决定,而不是人类的劳动。
爆发模式。把一大堆积压或一次大重构扔给集群,几十张工单在一个下午被尝试,而不是一个 sprint。
回归监视。集群持续重跑整个测试套件,在用户看到之前就标记出退化。
第 5 部分:破坏大多数首次尝试的失败模式
跳过独立的评审 agent。让写代码的同一个模型也批准它,注定会有盲区。
没有状态持久化。一个没有记忆的集群,每一轮都重试同一个坏掉的方案,而不是从上次的拒绝中学习。
没有真正的停止条件。"agent 说它完成了"不是停止条件。用一些可检查的东西:测试通过、错误率低于阈值、覆盖率高于某个设定值。
守住这三点,集群就能产出生产级的交付输出。
总结
交付软件已经是一条流水线。五个阶段:规格、实现、测试、评审、部署。
一个由五个专业化 agent 组成的集群,可以为你跑每个阶段,每个都用适合其复杂度的模型,持续运行,而不是等一个人类把工单挪到下一列。
你不再是自己当流水线。你成了架构师。
你仍然在手工把工单挪过看板,还是你已经成了那个在你睡觉时挪动它们的集群的构建者?
Prompts
npm install -g agent-orchestrator
mkdir ship-swarm
cd ship-swarm
orchestrator init
orchestrator /providers
export default async function shipSwarm(orchestrator) {
while (true) {
const ticket = await orchestrator.nextTicket();
const spec = await orchestrator.agent('spec-writer', {
model: 'fast',
task: 'Turn this ticket into a structured implementation plan: ' + ticket.body
});
const code = await orchestrator.agent('implementer', {
model: 'fast',
task: 'Write the implementation against the plan.',
spec
});
const tests = await orchestrator.agent('tester', {
model: 'fast',
task: 'Write and run unit and integration tests. Report coverage gaps.',
code
});
const review = await orchestrator.agent('reviewer', {
model: 'strong',
task: 'Check the diff for correctness, security issues, and style drift.',
code, tests
});
if (review.passed) {
await orchestrator.agent('deployer', {
model: 'fast',
task: 'Deploy to staging. Monitor error rates for two hours. Roll back on regression.',
code
});
}
await orchestrator.sleep('new-ticket');
}
}
Article tables:
Agent | Job | Model
Spec Writer | Turns a raw ticket into a structured implementation plan | Fast
Implementer | Writes the code against the plan | Fast
Tester | Writes and runs tests, flags coverage gaps | Fast
Reviewer | Checks the diff for bugs, security issues, and style drift | Strong
Deployer | Ships to staging, monitors, and rolls back on regression | Fast
Tags: # X # AI # Guide
Related articles
How I use Grok Bots to rank brands on AI answers that it feels illegal
Name this bot `CrowdReply - Scout`.
Grok Bot AI MCP Slack
原文参考:https://maxed.wiki/posts/how-to-build-a-swarm-of-ai-agents-that-ships-production-code-while-you-sleep/ (Maxed.wiki,本页为站内中文整理)