智能体 Harness 工程 vs 循环工程 vs 图工程

Agent Harness Engineering vs. Loop Engineering vs. Graph Engineering

中文译文 · 16k 字

一句话摘要

对比三种智能体工程方法

Agent 骨架工程 vs. 循环工程 vs. 图工程 2026 年 7 月 25 日 · 13 分钟阅读 · 查看原文 ↗ AI Loops Claude Advertising 一份关于人们总是混在一起的三个架构层次的实用指南 这种混淆是可以理解的。这三个概念都围绕同一个模型,三个都影响可靠性,三个都可能包含“循环”。但它们不是同义词。它们描述的是不同的工程决策,而这个区别,在 agent 离开 demo 笔记本、开始接触文件、API、客户或生产代码的那一刻,就变得至关重要了。 > 30 秒答案 骨架工程(Harness engineering)构建的是模型周围的机器 循环工程(Loop engineering)设计的是反复的“工作—反馈”循环 图工程(Graph engineering)让工作流拓扑变得显式:节点、分支、汇合、状态转换,以及受控的循环 干净的心智模型是:环境 → 反馈 → 流 为什么这些术语突然变得重要 一个原始的语言模型,无法创建文本、为一个项目维护状态、跑测试套件、看浏览器、执行审批规则,或重启一个失败的任务。那些能力来自它所处的环境。随着 agentic 软件走向成熟,一套标准的工程栈终于正在成形。最底层是 agent 骨架(harness),也就是真正运行模型的代码。往上是循环(loops),它们处理重复的执行和质量检查。最后,图(graphs)画出引导整个流程的结构化路径。 标签仍然没有一致地标准化。在当前框架里,“agent harness”(agent 骨架)这个词现在开始带上一个相当具体的定义。“loop engineering”(循环工程)是 2026 年在从业者之间兴起的一个较新的词。图工程(graph engineering)应当被务实地理解,而不是当作一个学术领域;它只是把 agent 工作流创建为显式的有向图或状态机的过程。这种实用的区分很有帮助,因为它防止一个流行词掩盖真正的设计问题。 Agent 骨架工程 根据 Langchain 的说法,agent 是模型加上骨架(harness),而骨架是模型之外的代码、配置和执行逻辑。实践中,这包括系统提示词、工具定义、记忆、文件系统、沙箱、模型路由、交接(handoff)、中间件钩子、上下文压缩(compaction)、权限、日志和验证接口。 OpenAI 的 Agents SDK 从运行时角度描述了同一个操作核心:runner 调用模型、执行工具调用、处理交接、携带状态,并且只在运行抵达一个真正的终止条件时才停止。 “骨架”这个词很有用,因为它把注意力从“模型崇拜”上移开。两个团队可以用同一个基础模型,得到截然不同的结果,因为一个给了模型干净的工具、一个稳定的工作区、受限的权限和可观测的状态,而另一个只给了它一个含糊的提示词和一个不可靠的 API 封装。智能可能是相似的;工作条件却不然。一个严肃的骨架通常包含: 上下文注入:指令、检索到的事实、对话状态、技能和任务专属策略 行动面:API、浏览器、shell、代码解释器、数据库,以及 MCP 兼容的工具 持久化:文件、检查点、会话、进度日志、git 历史,以及长期记忆 执行控制:超时、重试、预算、模型路由、子 agent 派生,以及审批闸门 安全与治理:权限、隔离、白名单、密钥处理,以及人工授权 可观测性:追踪、工具输入与输出、状态转换、成本、延迟和评估结果 模型坐在一个由上下文、控制、行动、持久化和验证构成的更宽骨架之内。把你的架构图里的模型删掉。剩下的一切,大概都属于骨架:工具、数据访问、状态存储、沙箱、中间件、评估器、重试策略和 UI。 > 骨架工程在哪里派上用场 骨架工作对长时间运行的任务很重要。在多会话编码中,Anthropic 发现单纯使用上下文压缩是不够的。这本身不是更好的提示词,而是他们做了一套好的设置,创建了一个初始化器、一个进度文件、git 历史,以及一种增量工作的纪律,让每一个新上下文都能理解发生了什么、还剩下什么要做。就 agent 而言,这是一个改进过的工作系统。当 agent 缺少某项能力、无法干净地回来、丢失状态、访问得太多、无法被审计,或在不同环境上表现不一致时,就应用骨架工程。 循环工程 每一个使用工具的 agent,都有一个内嵌的小循环: 调用模型 看结果 运行工具 把观测输入模型 重复,直到返回一个最终答案 当构建者围绕那个行为有意地构建或堆叠新的循环时,那就是循环工程的开始,正如 OpenAI 所称的那样。例如,一个验证循环让 agent 创建一件产出物、执行确定性的检查或一个评分器、收到显式反馈,并且只有在有证据表明存在错误时才重复。一个事件驱动循环在收到计划任务、webhook 或新文档时唤醒 agent。一个改进循环分析追踪和失败、修改指令/工具,并测试新版本是否更好。LangChain 2026 年的表述把这些称为一叠循环,而不是一个魔法般的 while 语句。 > 一个精心设计的循环的解剖结构: 触发器:是什么开启另一个循环;用户请求、计划任务、失败的测试、新数据或评估器反馈 目标:一个要抵达的具体状态,而不是一条“不断改进”的含糊指令 状态与记忆:下一个循环需要知道什么,而无需重放一切 行动策略:agent 可以改变、调用、委派或花费什么 证据:测试、schema 验证、引用、diff、指标或人工审阅 反馈:关于证据为何失败的一份紧凑、可行动的说明 停止规则:成功、预算上限、超时、不可恢复的错误,或人工升级 一个验证循环用一个外部评分器和一个显式的通过条件,包裹住 agent 循环。不要循环于“信心”。循环于“证据”。“agent 说它做完了”不是停止条件;“测试通过、链接解析、schema 验证、审阅者批准”才是。 > 为什么循环工程不只是提示词工程 一个提示词告诉模型在一次调用中该做什么。一个循环指定系统在调用之后做什么: > 它如何观察结果、选择反馈、决定是否继续、持久化进度并终止 提示词质量仍然重要,但循环把一次性的指令,变成了一个受管理的过程。主要的权衡是成本和延迟。每一个评分器、审阅者或重试,都会增加一次模型调用或工具运行。Anthropic 更广泛的指导是,倾向于能工作的最简单架构,只在性能收益证明其合理性时才添加 agentic 复杂性。同样的建议也适用于循环:在失败成本高于验证成本的地方,才添加它们。 图工程 图工程问的却是一个不同的问题:不只是 agent 做什么,而是哪一个组件被允许下一步运行。步骤用节点表示,允许的步骤用边表示。这些边可以用来表示顺序、条件分支、并行扇出、汇合、循环和人工中断。状态在图中穿行,拓扑允许对期望的控制流进行检查。LangGraph 是面向长时间运行、有状态 agent 的底层编排基础设施,具备持久执行、状态和人在环(human-in-the-loop)控制,且明确聚焦于对 agent 的控制,而非对工作流的抽象。Microsoft AutoGen 的文档异常直白:当你需要对 agent 的顺序进行精确控制、为不同结果设置不同的下一步、确定性的分支,或带循环的复杂多步流程时,用图。图工程师实际决定的: 节点边界:哪部分工作属于一个确定性函数、一次 LLM 调用、一个专家 agent,或一步人工审阅 状态 schema:每个节点可以读或更新什么,以及并行更新如何合并 路由条件:哪些证据把工作往前、往后、侧向发送,或升级 并发:什么可以并行跑,什么必须汇合,以及哪些共享资源需要协调 循环与出口:在哪里允许重试,允许多少次,以及什么让循环安全 持久性:检查点发生在哪里,以及中断后执行如何恢复 上面的画布让 agent、技能和关系作为一个组合系统变得可检视。图工程在这里意味着对基于图的执行进行工程化。它与知识图谱工程不是一回事——知识图谱里,图代表的是数据中的实体和关系。一个工作流图代表的是控制和状态转换。 > 一个图何时值得这些仪式感 当流程有有意义的分支、并行工作、审批、恢复路径或多个专家 agent 时,图是有价值的。当任务只是“给一个 agent 三个工具然后让它干活”时,图就没那么有用。图可以改进调试,但它也可能过早冻结假设。如果模型必须动态地发明计划,那把每一条可能的路径都强塞进一张图,会让系统更脆,而不是更不脆。 > 三个层次如何在一个真实系统里协同工作 考虑一个负责产出事实性行业简报的“调研—发布”agent 注意这种嵌套:图在骨架内部运行;一个或多个循环住在图内部;而骨架提供那些循环所需的状态、工具和评估器。这些类别会重叠,因为软件层次本来就是重叠的,但当系统失败时,每一个类别仍然给团队一根不同的杠杆去拉。 > 通过诊断失败来选择工程层次 症状 | 从哪开始 | 可能的修复 agent 无法安全地访问正确的数据或工具 | 骨架 | 工具契约、权限、沙箱、上下文注入 agent 跨会话忘记进度 | 骨架 | 持久状态、检查点、进度产出物、上下文压缩 第一次尝试往往接近但不稳定 | 循环 | 外部评分器、确定性测试、反馈和有界重试 agent 在成功之后继续干,或在证明之前就停下 | 循环 | 基于证据的终止状态,以及有预算意识的停止规则 多个专家必须以受控顺序运行 | 图 | 显式节点、边、路由条件和汇合 在多步流程中难以定位失败 | 图 + 骨架 | 与图节点和转换对齐的有状态追踪 工作流变化太频繁,不适合固定图表 | 更简单的骨架 | 保持控制由模型驱动;推迟图的正式化 弱 agent 架构背后的昂贵错误 > 在理解工作之前就构建图 团队有时在观察到有能力的 agent 实际如何解决它之前,就把一个业务流程翻译成几十个节点。从一个更简单骨架的追踪开始,然后再把稳定的路径正式化。 > 让同一个模型在没有防护的情况下既写又评分 自我审阅可以有帮助,但它容易受到共同盲点的影响。在可能的地方倾向确定性检查、分离审阅者的上下文,并要求对高影响动作进行人工批准。 > 用“继续尝试”作为循环规范 一个无界重试循环就是成本泄漏。每一个循环都需要一个可测量的目标、新鲜的证据、最大尝试次数,以及一条命名的升级路径。 > 把骨架当成垃圾场 更多的工具和记忆不会自动更好。拥挤的工具集会提高选择错误,嘈杂的上下文会提高困惑,宽泛的权限会提高风险。 > 把编排失败归咎于模型 一个模型无法可靠地补偿陈旧的状态、含糊的工具 schema、坏掉的 API 或缺失的退出条件。去改进那个拥有这项失败的层次。 一份生产就绪的设计清单 骨架:工具是否狭窄、有文档且可观测?状态是否持久?权限是否最小化?操作者能否暂停、检视并恢复一次运行? 循环:什么证据证明成功?失败时返回什么反馈?允许多少次重试?预算耗尽时会发生什么? 图:哪些路径必须是确定性的?哪里可以并行运行工作?哪些状态是共享的?哪里有人工闸门和恢复路线? 评估:团队能否回放真实追踪、比较版本,并把改进归因于某个具体改动,而非直觉? 运营:在生产中,成本、延迟、失败率、干预率和任务级成功率是否被监控? 记住这个区别的最简单方式 对某个东西进行工程化,使其成为一个模型,从而让它运转起来。循环工程的方法是迭代的、可验证的、可恢复的。通过使用图工程,一条复杂的执行路径被变得显式且可控。三者之中,没有哪一个能替代另外两个中的任何一个。即便骨架丢了状态,一张画得漂亮的图也是不够的。然而,即使有最好的骨架,如果没有证据或停止规则,那也是浪费钱!当分支、并行和审批被嵌进临时代码时,精心打造的循环仍然难以操作。如果这三个层次被联合设计,可靠的 agent 系统就会出现——前提是团队清楚每一个层次各自要解决什么问题。 读者用到的搜索词 agent harness vs loop engineering graph engineering for AI agents AI agent orchestration LLM agent architecture production AI agents LangGraph workflows AutoGen GraphFlow agent verification loops 来源与进一步阅读 The Anatomy of an Agent Harness - 学习 agent 骨架如何把 AI 模型转变成自主工作引擎。探索核心组件:文件系统、沙箱和记忆 Agents SDK | OpenAI API - 学习 OpenAI Agents SDK 如何拼在一起,以及接下来读哪些文档 LangChain and LangGraph Agent Frameworks Reach v1.0 Milestones - LangChain 1.0 和 LangGraph 1.0 来了。用标准化的工具、中间件定制和持久状态,更快构建生产级 AI agent GraphFlow (Workflows) - AutoGen - 本节你将学习如何用 AutoGen 创建一个多 agent 工作流,或简称 “flow”。它使用结构化执行,精确控制 agent 如何交互以完成任务。我们首先展示如何创建并运行一个 flow The Art of Loop Engineering - Agent 自动化真实世界的工作,但可靠的性能需要的不仅是一个好模型,它需要一个为具体任务精心设计的骨架。这篇文章探索核心 agent 循环、堆叠和扩展循环如何构建更有效的 agent,以及如何用 LangChain 原语对每一层进行插桩 Introducing AutoGen Studio from Microsoft Research - AutoGen Studio 构建在微软灵活的、用于编排 AI agent 的开源 AutoGen 框架之上,提供一个用户友好的界面,让开发者几乎不写代码就能快速构建、测试、定制和分享多 agent AI 解决方案 How to Build a Custom Agent Harness - 有效的 agent 是用与手头任务紧密耦合的骨架构建的。构建自定义骨架最简单的方式,是用 LangChain 的 create_agent 加中间件。本指南涵盖核心 agent 循环,以及如何为你的 agent 用例定制它 A practical guide to building agents - 一份设计、编排和部署 AI agent 的综合指南——涵盖用例、模型选择、工具设计、护栏和多 agent 模式 Building Effective AI Agents - 来自 Anthropic 及其客户关于构建生产级单 agent 和多 agent 系统的实用建议与指导 收藏这篇,免得弄丢 关注 @beamnxw 获取更多技术帖 :) 我的 Telegram 频道 标签:# X # AI # Loops # Claude # Advertising # Guide 相关文章 How to Build an AI-Native Company: Hiring, Standards, and Cadence *We spent a year running hackathons, AI trainings, and office hours. But nothing changed until we made AI capability a requirement.* AI Loops Claude Marketing

原文参考:https://maxed.wiki/posts/agent-harness-engineering-vs-loop-engineering-vs-graph-engineering/ (Maxed.wiki,本页为站内中文整理)