增长案例库 Maxed 归档 AI自动化AI搜索优化

Kimi K3 Swarm Max:如何用一句提示词运行 300 个研究智能体

Kimi K3 Swarm Max: how to run 300 research agents from a single prompt

中文译文 · 12k 字

一句话摘要

标题主题:如何用 Kimi K3 Swarm Max 从一句提示词运行 300 个研究智能体

Kimi K3 Swarm Max:如何用一条提示词跑300个研究 agent 2026年7月22日 · 11分钟阅读 · 查看原文 ↗ AI Marketing Finance Kimi K3 于2026年7月16日发布。2.8万亿参数。100万 token 上下文。有史以来发布的最大开源权重模型。 头条功能是 K3 Swarm Max:最多300个子 agent 并行运行,在4,000个步骤内协调,产出真实文件而不是聊天答案。两个变体共享同一个大脑。K3 Max 处理日常任务。K3 Swarm Max 让一支舰队对准问题。 大多数人打开 Kimi,输入一个问题,得到答案,关掉标签页。那大约是这个产品10%的能力。本指南覆盖另外90%。 这个 swarm 不是外挂。编排器是一个用"并行 Agent 强化学习"训练出来的已学习策略。你描述目标。swarm 决定如何拆分它、要启动多少个 agent、以及如何把结果缝合回来。Swarm 在广泛的、可并行的工作上获胜:50多个来源的研究、批量分析、竞品监测、数据集构建。它们在深度顺序任务上很吃力——那种第3步依赖第2步的任务。 写规格(spec),而不是提示词 "研究健身应用市场"就是你怎么烧掉额度并拿到垃圾的。一条单行提示词给了 swarm 决定一切的许可。它会决定错。 把 swarm 当成一个承包商。一份 spec 定义了要收集什么、什么算有效、允许哪些来源、确切的输出格式、以及遇到冲突时怎么办。这份 spec 是整个工作流里杠杆最高的产物,因为在 Level 2 里,它会变成你可复用 Skill 的种子。 # PROJECT: [名称] GOAL: [一句话,交付物,不是话题] SCOPE: [什么在里面,什么明确排除在外] RULES: [验证,什么算一条被证实的发现] SOURCES: [官方帖子、论文、只允许一手来源,不要聚合站] OUTPUT: [文件类型 / 数量 / 命名 / 格式细节] ON CONFLICT: 标记该行,永远不要静默解决 STOP CONDITION: [何时停下并报告,而不是瞎猜] 在花钱之前先读拆分计划 提交 spec 之后,Kimi 会在运行之前给你看执行计划:多少个子 agent、每个负责什么、依赖顺序、步骤预算。这是新手跳过的步骤,也是跳过后代价最昂贵的一个。 一个拆解错了的200-agent swarm,会花真钱。检查计划不花一分钱。你要找三样东西:它是否理解了范围、agent 数量对这个任务是否合理、以及输出计划是否匹配你真正需要的。 在我运行之前,给我看提议的拆分: - 多少个子 agent,每个负责什么 - 依赖顺序(什么阻塞什么) - 预估步骤预算 - 最大的质量下降风险在哪里 先不要执行。等我确认。 一个值得知道的细节:那4,000个步骤是整个 swarm 的协调总预算,不是每个 agent 4,000步。一次300-agent 的运行,平均每个 agent 大约13步。这告诉你你的任务是否符合这个形态。 运行它 现在你执行。最多300个子 agent 以并行波次启动,每个在自己的有界上下文里。只有结构化输出流回协调器。 从头到尾执行 spec。 在计划允许的地方尽可能并行。 立即标记任何阻塞,不要静默绕过。 把所有东西合并进 spec 里定义的 OUTPUT。 > Level 1 之后你得到什么 > > 一个由你的 spec 构建的单次 swarm 输出。原始、未经验证、但结构化。大多数人停在这里。价值从 Level 2 开始。 要求真实文件,而不是聊天答案 "一份全面的报告"给了 agent 提前停下的许可。"一份40页 PDF + 一个20,000行的 CSV + 14张可导出的 PNG 图表"给了它们一个质量目标。 永远用输出来引领 spec。输出层面的具体性,是"一支研究团队"和"一个昂贵的建议箱"之间的区别。 # 强输出示例: OUTPUT: 1 个 .xlsx,每个模型一行,+ 200字简述 OUTPUT: 30 个 HTML 文件,每个店铺一个,按企业名命名 OUTPUT: 40页 PDF + 20,000行 CSV + 14张 PNG 图表 用一个单独的模型对准输出 swarm 已知的缺陷:除非你明确要求验证,否则它会产出自信但引用不足的说法,而且独立的子 agent 有时会互相矛盾。"看起来做完了"和"是正确的"是两颗不同的行星。 用第二个模型作为验证闸门。它唯一的工作:反驳,不是夸奖。你不是在付高价 token 来生成。你是在付它们来在下一步把工作流存成可复用 Skill 之前,抓住那个沉默的缺陷。 你是验证者。一个 agent swarm 产出了随附的输出。 你唯一的工作是找出哪里错了。 检查: - 每一个声称的数字都能追溯到一个具名来源吗? - 有没有任何两个板块互相矛盾? - 有没有任何被当作事实呈现、实际上只是推断的东西? - 输出是否符合 spec 的格式要求? 对每个问题:引用确切位置和修复方法。 如果一切成立:APPROVED。 如果有任何一项失败:REJECTED + 最先给出那一条最关键的修复。 把整个工作流存成一个 Skill 在一次通过验证的运行之后,让 Kimi 捕获整个工作流:输入格式、agent 步骤、输出格式、验证规则。第一次运行花20分钟。之后的每次运行花30秒。Skill 就是让这个系统复利、而不是每次重启的原因。 把整个工作流存成一个可复用 Skill:"[名称]" 捕获: - 输入格式(它期待什么文件 / spec 形态) - 奏效的 agent 步骤 - 输出格式和命名约定 - spec 里的验证规则 下次我运行时,附上新文件,拿到同样的形态。 > Level 2 之后你得到什么 > > 一个你可以信任的已验证输出,和一个你无需重建 spec 就能重放的可复用 Skill。循环从这里开始复利。 把你自己的文档喂进去当 swarm 知识 Skill 捕获流程。Document-to-Skill 捕获领域。上传你最好的作品,Kimi 捕获它的结构指纹,作为每个未来 swarm 都会应用的一个技能。 你喂进去的每一个 PDF、逐字稿或电子表格,都会成为所有300个 agent 据以打底的上下文,而不是退回到训练数据。你喂得越多,输出就越读起来像你的作品,而不是泛泛的 AI。 把这个文档捕获成一个可复用技能。找出让它奏效的东西: - 结构和章节顺序 - 语气和语域 - 每个章节的分析深度 把它存成"[名称]"。然后用捕获的技能,在[另一个主题]上产出一份新文档。 匹配质量门槛,而不是内容。 把每一次拒绝变成一条永久规则 验证步骤抓住一个缺陷一次。这个步骤确保 swarm 再也不会犯它。把反馈蒸馏成硬规则,写进一个 swarm 在做任何事之前都会读的约束文件里。 # CONSTRAINTS.md,自动加载 - 每一个声称的数字都必须追溯到一手来源,否则被标记 - 不静默解决冲突:暴露矛盾 - [从上一次运行的验证者反馈里蒸馏出的规则] - [你永远不想再犯的那个错误] Scope-lock:不要碰 spec 的 SCOPE 块之外的任何东西。 在新输入上重放技能 这就是"复利"不再是一个流行词、而是出现在发票上的地方。第二次运行不从零开始。它从你上面构建的技能、swarm 知识和约束文件开始。同样的工作流、新文件、零头的设置量。 重放时经济账会剧烈改变。K3 的缓存命中定价对重复上下文降到每百万 token $0.30,比首次运行输入价便宜10倍。技能、约束和 spec 都是重复上下文。只有你的新输入文件按全价计费。第一次运行是投资。之后每一次运行都在收割回报。 输出也在结构上变好。Skill 强制格式。约束挡掉验证者已经抓过的每一个错误。swarm 知识让每个 agent 以你的真实文档为底,而不是训练数据。第四次运行不仅比第一次便宜,它产出更好的结果,因为系统从三轮真实反馈里学到了东西。 在这些新输入上运行已保存的技能 "[名称]"。 应用 CONSTRAINTS.md。使用捕获的输出格式。 [附上新文件] 把这次运行的输出和上次运行对比。 报告: - 上次没有的新发现 - 自上次运行以来变化的发现 - 任何消失了的东西(标记为潜在缺口) - 与技能预期形态的偏差 > Level 3 之后你得到什么 > > 一条自我改进的研究流水线。每次运行都比上次更便宜、更快、更准,因为技能库、知识库和约束文件一直在增长。 把技能升级成一个定时 agent 一旦循环稳定、有技能背书,你就不再手动启动它。给 Kimi 一个触发器:一个时间表、一次新文件落下、一个被监测的 URL。让它主动跑完整个 swarm,只把交付物和值得你注意的偏差浮出来。 竞品监测是最干净的示例。第一次运行:你手动构建并验证。等它变成一个后台 agent 时,它每周并行检查每一个竞品,以零边际时间成本往你收件箱里丢一份简报。循环里剩下唯一的人类,是你设定的那个问题、以及你基于答案做出的那个决定。 按周计划运行技能 "[名称]"。 触发器:[时间表 / 新文件 / 被监测的 URL] 每次运行时:执行 swarm,应用 CONSTRAINTS.md, 验证,然后交付 OUTPUT + 一份与上次运行的 diff。 只有当偏差超过 [阈值] 时才 ping 我。 2.8T 参数修不了的东西 幻觉随并行度而放大。更多 agent 搜索,意味着更多自信的错误答案,除非你跑一遍验证。swarm 不会自己核查事实。 K3 的成本比 K2.6 贵3-4倍。输入:$3.00/M vs $0.95/M。输出:$15.00/M vs $4.00/M。缓存对重放有帮助,但第一次运行很贵。如果纯为成本优化,K2.6 仍然是预算之选。 开源权重还没出来。Moonshot 承诺在2026年7月27日前放出。在那之前,K3 只能通过 API 和 Kimi 应用运行。 Swarm 会放大糟糕的 spec。一个含糊的提示词经过一个 agent,浪费一个上下文窗口。经过300个 agent,就是并行浪费300个。 短清单 单行提示词。swarm 决定一切。它决定错。 跳过拆分审查。跳过代价最昂贵的一步。 没有验证。 "看起来做完了"不是"是正确的"。 把未验证的输出存成技能。这个错误在每一次未来运行里复利。 在顺序任务上用300个 agent。一个 swarm 无法并行化一条思维链。 在 K2.6 够用的地方用 K3。不是每个任务都需要2.8T参数。 结论 大多数人会打开 Kimi、输入一个问题、关掉标签页。那是聊天框。它大约占 K3 能力的10%。 另外90%是一支你搭建一次、永久重放的研究团队。每一级解锁更多杠杆:先是运行,然后是信任,然后是复利,然后是自主。你不需要第一天就集齐四个。从 Level 1 和一份 spec 开始。如果输出有用,就进入 Level 2 去验证它。如果你打算再跑一次,就存成 Skill。系统从那里开始自己变锋利。 写 spec,而不是提示词。在保存之前先验证。然后看着每一次运行都比上一次更便宜、更锋利。 标签:# X # AI # Marketing # Finance # Guide 相关文章 What Watching Fomo's Rise Taught Me About Vector *Reflections on product-market fit, finding a bigger market, and the future of social trading.* Crypto Finance Marketing AI

原文参考:https://maxed.wiki/posts/kimi-k3-swarm-max-how-to-run-300-research-agents-from-a-single-prompt/ (Maxed.wiki,本页为站内中文整理)