如何打造一群在你睡觉时交付生产代码的 AI Agent

How to Build a Swarm of AI Agents That Ships Production Code While You Sleep

中文译文 · 7k 字

一句话摘要

构建一组 AI Agent 在无人值守时自动交付生产级代码。

如何构建一个 AI agent 集群,在你睡觉时交付生产代码 July 14, 2026 · 6 min read · View source ↗ AI 我将拆解如何构建一个 AI agent 集群,它替代了软件团队日常所做的大部分工作。 直接开始。 我以开发开发者工具和 agentic 系统为生。我关注的是,当 AI agent 触及真实生产流水线时它们会如何表现,而不是玩具 demo。私信开放,欢迎合作。 在我上一篇文章里,我说我会带一小批构建者走一遍他们的第一个 agentic 流水线设置。已经有几个人跟我走完了,其中一个现在正在跑一个完整的自我交付循环。 这个提议依然有效。如果你在构建类似的东西,回复或私信我你当前的设置,我会指出它与真正集群之间的差距。 大多数开发者仍然用十年前的方式交付代码。他们开一张工单。他们写函数。他们写测试。他们开一个 pull request。他们等。他们合并。他们盯着仪表盘。 他们自己就是那条流水线。 如今用 AI 构建的最有生产力的团队已经不再这样做了。他们改为构建集群。每个 agent 拥有一个阶段。各个阶段并行运行。版本在团队睡觉时发布。 一位在快速增长 AI 创业公司的工程负责人,不久前说得非常直白: "我不再写代码了。现在我写的是写出代码的那个循环。" 这一句话,就是集群如此重要的原因。 交付软件本来就已经是一条流水线:规格、实现、测试、评审、部署、监控。每一个运转良好的工程组织都在跑这个序列。过去的唯一区别是,它需要十几个工程师坐在每个阶段里。现在不再需要了。 我花了过去几周搭建这个集群。它一夜之间读完工单。它起草实现计划。它写代码。它写并运行测试。它对着第二个模型评审自己的 diff。它开 PR,并在任何人类看它之前标记出任何有风险的地方。 到这篇文章结束时,你将了解一个五 agent 交付集群的架构、在一个周末搭建它的设置,以及破坏大多数首次尝试的三种失败模式。 我们开始。 第 1 部分:集群到底是什么 一个提示词问一次问题,然后停下。 一个循环持续工作,检查自己的进度,直到任务真正完成。 一个集群是多个并行运行的循环,每一个都是专家,每一个的输出喂给下一个。 这就是全部的心智模型。 第 2 部分:运行它的设置 用普通脚本手工搭这个,很快就会崩。当一个 agent 需要等另一个 agent 时,它崩了。当你的状态需要跨周期持久化时,它崩了。当你想让五个循环在五个不同的模型上并行运行时,它崩了。 你真正需要的,是一个编排层,它能够: 把一个任务扇出到专业化的循环 把任意模型指派给任意步骤 在运行之间保持状态 持续运行,直到一个真实、可检查的条件被满足 第 1 步:安装 CLI 第 2 步:连接你的模型 对于规格编写、实现和测试这类样板步骤,用一个又快又便宜的模型;评审步骤用一个更强的推理模型。 第 3 步:起草循环 用大白话告诉 CLI 你想要什么: draft me a program that runs five agents in sequence: spec writer, implementer, tester, reviewer, deployer. run it every time a new ticket lands. use the fast model for the first three agents and the strong model for review. 下面大概就是最终循环的样子: 这就是整个集群。一个文件。五个 agent。永远运行。 第 3 部分:五个 agent 每一个严肃的工程组织都跑同样的五个交付阶段。下面就是替代它们的集群。 创作者从不评审创作者自己的工作。Reviewer 永远运行在一个与写出代码不同的、更强的模型上。 第 4 部分:它如何替代一个团队 过夜交付。集群在团队睡觉时消化积压任务。每天早上,都有已经实现、测试、评审过的 pull request 等在那里,等待的是一个人类的决定,而不是人类的劳动。 爆发模式。把一大堆积压或一次大重构扔给集群,几十张工单在一个下午被尝试,而不是一个 sprint。 回归监视。集群持续重跑整个测试套件,在用户看到之前就标记出退化。 第 5 部分:破坏大多数首次尝试的失败模式 跳过独立的评审 agent。让写代码的同一个模型也批准它,注定会有盲区。 没有状态持久化。一个没有记忆的集群,每一轮都重试同一个坏掉的方案,而不是从上次的拒绝中学习。 没有真正的停止条件。"agent 说它完成了"不是停止条件。用一些可检查的东西:测试通过、错误率低于阈值、覆盖率高于某个设定值。 守住这三点,集群就能产出生产级的交付输出。 总结 交付软件已经是一条流水线。五个阶段:规格、实现、测试、评审、部署。 一个由五个专业化 agent 组成的集群,可以为你跑每个阶段,每个都用适合其复杂度的模型,持续运行,而不是等一个人类把工单挪到下一列。 你不再是自己当流水线。你成了架构师。 你仍然在手工把工单挪过看板,还是你已经成了那个在你睡觉时挪动它们的集群的构建者? Prompts npm install -g agent-orchestrator mkdir ship-swarm cd ship-swarm orchestrator init orchestrator /providers export default async function shipSwarm(orchestrator) { while (true) { const ticket = await orchestrator.nextTicket(); const spec = await orchestrator.agent('spec-writer', { model: 'fast', task: 'Turn this ticket into a structured implementation plan: ' + ticket.body }); const code = await orchestrator.agent('implementer', { model: 'fast', task: 'Write the implementation against the plan.', spec }); const tests = await orchestrator.agent('tester', { model: 'fast', task: 'Write and run unit and integration tests. Report coverage gaps.', code }); const review = await orchestrator.agent('reviewer', { model: 'strong', task: 'Check the diff for correctness, security issues, and style drift.', code, tests }); if (review.passed) { await orchestrator.agent('deployer', { model: 'fast', task: 'Deploy to staging. Monitor error rates for two hours. Roll back on regression.', code }); } await orchestrator.sleep('new-ticket'); } } Article tables: Agent | Job | Model Spec Writer | Turns a raw ticket into a structured implementation plan | Fast Implementer | Writes the code against the plan | Fast Tester | Writes and runs tests, flags coverage gaps | Fast Reviewer | Checks the diff for bugs, security issues, and style drift | Strong Deployer | Ships to staging, monitors, and rolls back on regression | Fast Tags: # X # AI # Guide Related articles How I use Grok Bots to rank brands on AI answers that it feels illegal Name this bot `CrowdReply - Scout`. Grok Bot AI MCP Slack

原文参考:https://maxed.wiki/posts/how-to-build-a-swarm-of-ai-agents-that-ships-production-code-while-you-sleep/ (Maxed.wiki,本页为站内中文整理)