斯坦福和 Anthropic 发现了一个比任何 AI 模型都强大的系统

Stanford and Anthropic discovered a system more powerful than any AI model.

中文译文 · 9k 字

一句话摘要

标题主题:斯坦福和 Anthropic 发现的比任何 AI 模型都强大的系统

斯坦福和 Anthropic 发现了一个比任何 AI 模型都更强大的系统。 2026 年 7 月 18 日 · 8 分钟阅读 · 查看原文 ↗ Claude AI MCP Automation 现在,你可以让普通的 Claude 或 GPT 生产率提升 10 倍。不是靠更好的模型。不是靠更贵的套餐。而是靠模型周围那个正确的系统。 斯坦福花了好几年研究这个。Anthropic 花了好几年在生产环境里构建它。两者独立地得出了同一个结论,并各自发布了大多数人永远不会去读的文档。 > 收藏这篇并关注——我是 Noryxx,一名牛津学生,正在构建 AI 系统和自动化流水线。我分享项目、实验,以及把技术变成真实价值的实用方法。私信开放。 你现在就在读它们——作为你今天就能应用的具体原则。 为什么模型不再是核心问题 直到 2023 年,所有人都在争论一件事:GPT-4 还是 Claude,OpenAI 还是 Anthropic,哪个模型更聪明。 那是个错误的问题。 2022 | 哪个模型最聪明 2023 | 哪个提示词给出最好的结果 2024 | 给模型什么上下文 2025 | 如何在模型周围搭建流水线 2026 | 如何构建一个能自我优化的系统 Anthropic 的工程师现在每天合并的代码量是一年前 8 倍。同样的模型。同样的团队。不同的是模型周围的系统。 下面就是这个系统的样子。 文档 1 - DSPy 斯坦福 NLP 小组,2023 年 10 月。 > github.com/stanfordnlp/dspy > arxiv.org/abs/2310.03714 最近几年最重要的论文之一,而大多数开发者从来没读过。 核心思想:开发者不再写提示词。他们编程一个系统。 没有 DSPy: 问题 → 提示词 → 模型 → 答案 开发者猜测哪条提示词会奏效 有了 DSPy: 问题 ↓ 检索器 - 找到相关信息 ↓ 推理 - 处理和分析 ↓ 验证器 - 检查结果 ↓ 答案 模型变成执行图里的一个节点。不再是中心——而是一个组件。就像数据库是 web 应用的一个组件,而不是应用本身。 DSPy 最重要的部分是编译器。它会自动优化整条流水线,朝着你定义的某个指标前进。你说你想要什么结果,以及如何衡量质量。编译器自己找到最佳的指令和步骤序列。 任务定义 ↓ 指标 ↓ DSPy 编译器 ↓ 优化后的流水线 ↓ 比任何人类手写的结果都更好 提示词不再由手写。一个算法来优化它。这正是同一个模型在正确系统里给出截然不同结果的核心原因之一。 文档 2 - STORM 斯坦福 OVAL 小组,2024 年 2 月。 github.com/stanford-oval/storm arxiv.org/abs/2402.14207 STORM 展示了一个大多数人忽略的事实:即便是"写一篇文章"这样的"简单"任务,被拆成一个系统之后也会变得好得多。 单个提示词: 问题 → 模型 → 文章 质量平庸,没有来源验证 STORM: 问题 ↓ 研究 - agent 调查主题 ↓ 来源收集 - 收集真实来源 ↓ 大纲 - 搭建结构 ↓ 写作 - 逐节撰写 ↓ 验证 - 核对事实 ↓ 修订 - 纠正和改进 ↓ 最终文章 同样的模型。完全不同的结果。因为它是系统,不是提示词。 STORM 看起来更像一个新闻编辑部,而不是一个聊天机器人。每一步都有角色。每一步都在检查上一步。这就是任何复杂任务里,严肃的 AI 系统应该被构建的方式。 文档 3 - MIPRO 斯坦福,2024 年 6 月。 arxiv.org/abs/2406.11695 如果 DSPy 优化流水线——那么 MIPRO 优化的就是指令本身。 核心思想:提示词不再是一个某人写过一次就静止不变的对象。它变成一个系统自动优化的变量。 任务 ↓ 评估 - 衡量当前结果 ↓ 优化 - 算法生成新的指令 ↓ 新提示词 - 比任何人类写的都好 ↓ 更好的结果 与其你在每次犯错之后花几个小时重写提示词——系统自己来。自动地。结果是:任何人类提示词工程师都不会手写的指令,因为算法找到了人类会漏掉的模式。 文档 4 - GEPA 斯坦福 DSPy 研究,2026 年 7 月。 arxiv.org/abs/2507.19457 这份清单里最新、也最激进的论文。 GEPA - 反思式提示词进化。一个反思自己结果、并改进下一次运行的系统。没有强化学习。没有微调。只有反思。 执行 - 执行任务 ↓ 反思 - 分析哪里出错了、为什么 ↓ 改进 - 基于分析生成更好的方法 ↓ 再次执行 - 用改进后的指令重复 ↓ 重复 结果:一个每次运行都在变好、而无需任何人类干预的系统。GEPA 已经成为官方 DSPy 研究路线图的一部分——这不是实验,这是整个领域前进的方向。 文档 5 - Claude Code Anthropic,2025-2026。 docs.claude.com github.com/anthropics/anthropic-cookbook 斯坦福在搭建理论的时候——Anthropic 在生产环境里搭了同样的东西。 Claude Code 不像一个聊天那样工作。它像一个工程 agent 一样工作,带有一套和 DSPy 流水线一模一样的步骤系统。 聊天机器人方式: 问题 → Claude → 答案 一次回复,没有记忆,没有验证 Claude Code 方式: 仓库 ↓ 文档 - 读取 AGENTS.md、所有文档 ↓ 工具使用 - 使用真实工具 ↓ 执行 - 执行并观察结果 ↓ 验证 - 检查结果是否正确 ↓ 迭代 - 重复直到达成目标 Claude Code 里的 AGENTS.md = DSPy 里的 Skills。系统每个会话自动读取的已存指令。 Claude Code 里的 /goal = DSPy 里的验证器。一个定义任务何时完成的客观条件。 Claude Code 里的子 agent = DSPy 里的多模块流水线。每个专业 agent 各司其职,好过一个 agent 包揽一切。 斯坦福和 Anthropic 用的是不同的术语。但他们构建的是同一个东西。 文档 6 - MCP Anthropic,2024 年 11 月。 github.com/modelcontextprotocol Anthropic 迈出了斯坦福尚未在这个规模上迈出的一步——他们发布了一个把 AI 系统连接到真实世界的协议。 在 MCP 之前: LLM → 每个工具都要单独集成 GitHub API 单独。Slack API 单独。数据库单独。 有了 MCP: LLM ↓ MCP 协议 ↓ 文件系统 | GitHub | Slack | 数据库 | 浏览器 模型不再被孤立。它变成系统的中心,而这个系统拥有完成真实工作所需的一切。 实际结果:一个不止说"这是修复方案"的 agent,而是一个自己打开 PR、关联工单、在 Slack 上 ping 一下、并更新文档的 agent——全程无需一个人类坐在椅子上。 斯坦福和 Anthropic 一起搞明白的东西 DSPy | 模型是图里的一个节点,不是中心 STORM | 复杂任务需要一个步骤系统 MIPRO | 提示词由算法优化,而非人类 GEPA | 系统反思并自我改进 Claude Code | 同样的原则在生产环境中 MCP | 系统连接到真实世界 两者独立得出的共同结论: AI 领域的竞争优势,不再由你使用哪个模型决定。它由模型周围的系统设计得有多好决定——它的流水线、优化、反思、工具,以及它与真实环境的连接。 改变结果的五条原则 原则 1 | 模型是一个组件,不是产品 | 就像数据库是应用的一个组件 原则 2 | 系统里的每一步都有独立角色 | 研究、规划、执行、验证——各自分开 原则 3 | 验证是强制且客观的 | 模型无法验证自己 原则 4 | 系统在过程中自我优化 | MIPRO、GEPA、/goal——全都在讲这个 原则 5 | 系统连接到真实世界 | MCP、工具、连接器——不是一个孤立的聊天 糟糕的 AI 系统: 问题 → 模型 → 答案 好的 AI 系统: 问题 ↓ 检索器 - 找到相关上下文 ↓ 规划器 - 把任务拆成步骤 ↓ 执行器 - 用真实工具执行 ↓ 验证器 - 客观地检查结果 ↓ 反思器 - 分析错误、改进方法 ↓ 答案 它们之间的区别不是模型。区别是架构。 今天从哪里开始 第 1 天 - 读 github.com/stanfordnlp/dspy 上的 DSPy README。理解"写提示词"和"编程一个系统"的区别。为你的项目创建一个 AGENTS.md。 第 2 天 - 看看 STORM 如何把任务拆成步骤。把同样的逻辑应用到你最频繁的任务上。把它拆成研究、规划、执行、验证。 第 3 天 - 用全栈配置 Claude Code。AGENTS.md、skills 文件、一个用于审查的子 agent。连接一个 MCP 连接器——没有别的就先用 GitHub。 第 4 天 - 跑你的第一个 /goal。给系统一个带客观完成条件的任务。看着它干活,而你去做别的事。 这四天给你的东西,会超过一年重写提示词。因为你在构建一个系统,而不是在寻找魔法咒语。 Anthropic 工程师每天合并 8 倍的代码。斯坦福研究者在不换模型的情况下发布了打败最先进水平的结果。两者从相反的方向,用了同样的原则。 大多数人会继续重写提示词,等待更好的模型。少数人会构建正确的系统,然后不再依赖谁来发布下一款 GPT 或 Claude。 / 如果这对你有用——收藏并关注 标签:# X # Claude # AI # MCP # Automation # Guide # Chatgpt 相关文章 《图工程(Graph Engineering)在微软、斯坦福和 Anthropic 取代了 RAG。它是这样工作的。》 收藏这篇并关注——我是 Sprytix,一名构建 AI 系统和自动化流水线、把技术变成真实收入的开发者。私信开放。 Claude AI MCP Automation

原文参考:https://maxed.wiki/posts/stanford-and-anthropic-discovered-a-system-more-powerful-than-any-ai-model/ (Maxed.wiki,本页为站内中文整理)