一句话摘要
标题主题:斯坦福和 Anthropic 发现的比任何 AI 模型都强大的系统
斯坦福和 Anthropic 发现了一个比任何 AI 模型都更强大的系统。
2026 年 7 月 18 日 · 8 分钟阅读 · 查看原文 ↗ Claude AI MCP Automation
现在,你可以让普通的 Claude 或 GPT 生产率提升 10 倍。不是靠更好的模型。不是靠更贵的套餐。而是靠模型周围那个正确的系统。
斯坦福花了好几年研究这个。Anthropic 花了好几年在生产环境里构建它。两者独立地得出了同一个结论,并各自发布了大多数人永远不会去读的文档。
> 收藏这篇并关注——我是 Noryxx,一名牛津学生,正在构建 AI 系统和自动化流水线。我分享项目、实验,以及把技术变成真实价值的实用方法。私信开放。
你现在就在读它们——作为你今天就能应用的具体原则。
为什么模型不再是核心问题
直到 2023 年,所有人都在争论一件事:GPT-4 还是 Claude,OpenAI 还是 Anthropic,哪个模型更聪明。
那是个错误的问题。
2022 | 哪个模型最聪明
2023 | 哪个提示词给出最好的结果
2024 | 给模型什么上下文
2025 | 如何在模型周围搭建流水线
2026 | 如何构建一个能自我优化的系统
Anthropic 的工程师现在每天合并的代码量是一年前 8 倍。同样的模型。同样的团队。不同的是模型周围的系统。
下面就是这个系统的样子。
文档 1 - DSPy
斯坦福 NLP 小组,2023 年 10 月。
> github.com/stanfordnlp/dspy
> arxiv.org/abs/2310.03714
最近几年最重要的论文之一,而大多数开发者从来没读过。
核心思想:开发者不再写提示词。他们编程一个系统。
没有 DSPy:
问题 → 提示词 → 模型 → 答案
开发者猜测哪条提示词会奏效
有了 DSPy:
问题
↓
检索器 - 找到相关信息
↓
推理 - 处理和分析
↓
验证器 - 检查结果
↓
答案
模型变成执行图里的一个节点。不再是中心——而是一个组件。就像数据库是 web 应用的一个组件,而不是应用本身。
DSPy 最重要的部分是编译器。它会自动优化整条流水线,朝着你定义的某个指标前进。你说你想要什么结果,以及如何衡量质量。编译器自己找到最佳的指令和步骤序列。
任务定义
↓
指标
↓
DSPy 编译器
↓
优化后的流水线
↓
比任何人类手写的结果都更好
提示词不再由手写。一个算法来优化它。这正是同一个模型在正确系统里给出截然不同结果的核心原因之一。
文档 2 - STORM
斯坦福 OVAL 小组,2024 年 2 月。
github.com/stanford-oval/storm arxiv.org/abs/2402.14207
STORM 展示了一个大多数人忽略的事实:即便是"写一篇文章"这样的"简单"任务,被拆成一个系统之后也会变得好得多。
单个提示词:
问题 → 模型 → 文章
质量平庸,没有来源验证
STORM:
问题
↓
研究 - agent 调查主题
↓
来源收集 - 收集真实来源
↓
大纲 - 搭建结构
↓
写作 - 逐节撰写
↓
验证 - 核对事实
↓
修订 - 纠正和改进
↓
最终文章
同样的模型。完全不同的结果。因为它是系统,不是提示词。
STORM 看起来更像一个新闻编辑部,而不是一个聊天机器人。每一步都有角色。每一步都在检查上一步。这就是任何复杂任务里,严肃的 AI 系统应该被构建的方式。
文档 3 - MIPRO
斯坦福,2024 年 6 月。
arxiv.org/abs/2406.11695
如果 DSPy 优化流水线——那么 MIPRO 优化的就是指令本身。
核心思想:提示词不再是一个某人写过一次就静止不变的对象。它变成一个系统自动优化的变量。
任务
↓
评估 - 衡量当前结果
↓
优化 - 算法生成新的指令
↓
新提示词 - 比任何人类写的都好
↓
更好的结果
与其你在每次犯错之后花几个小时重写提示词——系统自己来。自动地。结果是:任何人类提示词工程师都不会手写的指令,因为算法找到了人类会漏掉的模式。
文档 4 - GEPA
斯坦福 DSPy 研究,2026 年 7 月。
arxiv.org/abs/2507.19457
这份清单里最新、也最激进的论文。
GEPA - 反思式提示词进化。一个反思自己结果、并改进下一次运行的系统。没有强化学习。没有微调。只有反思。
执行 - 执行任务
↓
反思 - 分析哪里出错了、为什么
↓
改进 - 基于分析生成更好的方法
↓
再次执行 - 用改进后的指令重复
↓
重复
结果:一个每次运行都在变好、而无需任何人类干预的系统。GEPA 已经成为官方 DSPy 研究路线图的一部分——这不是实验,这是整个领域前进的方向。
文档 5 - Claude Code
Anthropic,2025-2026。
docs.claude.com github.com/anthropics/anthropic-cookbook
斯坦福在搭建理论的时候——Anthropic 在生产环境里搭了同样的东西。
Claude Code 不像一个聊天那样工作。它像一个工程 agent 一样工作,带有一套和 DSPy 流水线一模一样的步骤系统。
聊天机器人方式:
问题 → Claude → 答案
一次回复,没有记忆,没有验证
Claude Code 方式:
仓库
↓
文档 - 读取 AGENTS.md、所有文档
↓
工具使用 - 使用真实工具
↓
执行 - 执行并观察结果
↓
验证 - 检查结果是否正确
↓
迭代 - 重复直到达成目标
Claude Code 里的 AGENTS.md = DSPy 里的 Skills。系统每个会话自动读取的已存指令。
Claude Code 里的 /goal = DSPy 里的验证器。一个定义任务何时完成的客观条件。
Claude Code 里的子 agent = DSPy 里的多模块流水线。每个专业 agent 各司其职,好过一个 agent 包揽一切。
斯坦福和 Anthropic 用的是不同的术语。但他们构建的是同一个东西。
文档 6 - MCP
Anthropic,2024 年 11 月。
github.com/modelcontextprotocol
Anthropic 迈出了斯坦福尚未在这个规模上迈出的一步——他们发布了一个把 AI 系统连接到真实世界的协议。
在 MCP 之前:
LLM → 每个工具都要单独集成
GitHub API 单独。Slack API 单独。数据库单独。
有了 MCP:
LLM
↓
MCP 协议
↓
文件系统 | GitHub | Slack | 数据库 | 浏览器
模型不再被孤立。它变成系统的中心,而这个系统拥有完成真实工作所需的一切。
实际结果:一个不止说"这是修复方案"的 agent,而是一个自己打开 PR、关联工单、在 Slack 上 ping 一下、并更新文档的 agent——全程无需一个人类坐在椅子上。
斯坦福和 Anthropic 一起搞明白的东西
DSPy | 模型是图里的一个节点,不是中心
STORM | 复杂任务需要一个步骤系统
MIPRO | 提示词由算法优化,而非人类
GEPA | 系统反思并自我改进
Claude Code | 同样的原则在生产环境中
MCP | 系统连接到真实世界
两者独立得出的共同结论:
AI 领域的竞争优势,不再由你使用哪个模型决定。它由模型周围的系统设计得有多好决定——它的流水线、优化、反思、工具,以及它与真实环境的连接。
改变结果的五条原则
原则 1 | 模型是一个组件,不是产品
| 就像数据库是应用的一个组件
原则 2 | 系统里的每一步都有独立角色
| 研究、规划、执行、验证——各自分开
原则 3 | 验证是强制且客观的
| 模型无法验证自己
原则 4 | 系统在过程中自我优化
| MIPRO、GEPA、/goal——全都在讲这个
原则 5 | 系统连接到真实世界
| MCP、工具、连接器——不是一个孤立的聊天
糟糕的 AI 系统:
问题 → 模型 → 答案
好的 AI 系统:
问题
↓
检索器 - 找到相关上下文
↓
规划器 - 把任务拆成步骤
↓
执行器 - 用真实工具执行
↓
验证器 - 客观地检查结果
↓
反思器 - 分析错误、改进方法
↓
答案
它们之间的区别不是模型。区别是架构。
今天从哪里开始
第 1 天 - 读 github.com/stanfordnlp/dspy 上的 DSPy README。理解"写提示词"和"编程一个系统"的区别。为你的项目创建一个 AGENTS.md。
第 2 天 - 看看 STORM 如何把任务拆成步骤。把同样的逻辑应用到你最频繁的任务上。把它拆成研究、规划、执行、验证。
第 3 天 - 用全栈配置 Claude Code。AGENTS.md、skills 文件、一个用于审查的子 agent。连接一个 MCP 连接器——没有别的就先用 GitHub。
第 4 天 - 跑你的第一个 /goal。给系统一个带客观完成条件的任务。看着它干活,而你去做别的事。
这四天给你的东西,会超过一年重写提示词。因为你在构建一个系统,而不是在寻找魔法咒语。
Anthropic 工程师每天合并 8 倍的代码。斯坦福研究者在不换模型的情况下发布了打败最先进水平的结果。两者从相反的方向,用了同样的原则。
大多数人会继续重写提示词,等待更好的模型。少数人会构建正确的系统,然后不再依赖谁来发布下一款 GPT 或 Claude。
/ 如果这对你有用——收藏并关注
标签:# X # Claude # AI # MCP # Automation # Guide # Chatgpt
相关文章
《图工程(Graph Engineering)在微软、斯坦福和 Anthropic 取代了 RAG。它是这样工作的。》
收藏这篇并关注——我是 Sprytix,一名构建 AI 系统和自动化流水线、把技术变成真实收入的开发者。私信开放。 Claude AI MCP Automation
原文参考:https://maxed.wiki/posts/stanford-and-anthropic-discovered-a-system-more-powerful-than-any-ai-model/ (Maxed.wiki,本页为站内中文整理)