智能体 AI 架构详解:从 LLM 到自主智能体

Agentic AI Architecture Explained: From LLMs to Autonomous Agents

中文译文 · 18k 字

一句话摘要

解析从 LLM 到自主智能体的架构

Agentic AI 架构详解:从 LLM 到自主智能体 2026 年 8 月 27 日 · 17 分钟阅读 · 查看原文 ↗ AI 循环(Loops) 如果你刚刚踏入人工智能的世界,你大概已经注意到,人们谈论 AI 的方式发生了一次巨大的转变。一年前,所有人都痴迷于"聊天机器人"。你在一个框里输入问题,AI 输入一个答案作为回应。那很神奇,但它也是被动的。AI 只在你跟它说话时才工作。 如今,整个科技行业已经转向了一个新的痴迷:Agentic AI(智能体式 AI)。 我们不再构建只会跟你说话的软件,而是在构建为你工作的软件。想象一下,你想调研一个竞争对手的定价。用聊天机器人,你得自己上网搜索、复制文字、粘贴到聊天窗口里,然后让 AI 总结它。而用一个 AI Agent(智能体),你只需要说:"找到我的前三个竞争对手,读他们的定价页面,把摘要存到一个电子表格里。"这个智能体会前往互联网,点击链接,读取数据,格式化电子表格,做完之后给你发消息。 但一个聊天机器人是怎么突然长出"手"来的?一个生成文本的 AI,是怎么学会浏览网页、点击按钮的? 在这份面向初学者的指南里,我们将拆解 Agentic AI 的架构。我们会打开引擎盖,精确解释开发者是如何把一个简单的大语言模型(LLM)变成一个完全自主的数字员工的。我们会拆解四个核心组件:大脑(Brain)、记忆(Memory)、工具(Tools)和规划循环(Planning Loop)。 你不需要一个计算机科学学位就能理解这些。读完这篇文章,你将精确理解软件的未来是如何被构建的。 1. 最大的区别:LLM 与 Agent 在深入架构之前,我们需要先厘清初学者最大的困惑点:LLM 和 Agent 之间有什么区别? 罐子里的大脑 把一个大型语言模型(比如 GPT-4 或 Claude)想象成一个漂浮在玻璃罐里的聪明大脑。 这个大脑几乎读完了互联网上的每一本书、每一篇文章和每一个代码库。它聪明得不可思议。如果你问它一个问题,它能给你一个精彩的答案。但因为它被困在罐子里,它什么也做不了。它发不了邮件。它读不了实时网页。它查不了你的日历。它完全与外界隔绝。 有身体的大脑 一个 AI Agent,就是那个一模一样的大脑,只不过被从罐子里拿出来,放进了一个机器人的身体里。 底层智能完全一样——Agent 仍然用 LLM 来思考。但开发者写了环绕它的软件,给了这个大脑机械臂(工具 Tools)、一个用来记事的记事本(记忆 Memory),以及一套关于如何达成目标的指令(规划循环 The Planning Loop)。 LLM 生成文本。Agent 生成行动。 这就是我们所说的"Agentic 架构"。我们谈论的,是包裹在语言模型周围、赋予它在数字世界里行动能力(agency)的那套软件结构。让我们拆解这个架构的四大支柱。 2. 支柱一:大脑(语言模型) 每一个 AI Agent 正中心的,是大脑。也就是那个大语言模型。 在传统的聊天机器人里,我们用 LLM 写诗、起草邮件、解释复杂话题。但在 Agentic 架构里,我们把 LLM 用于一个完全不同的目的:逻辑与路由。 当一个 LLM 作为智能体的大脑工作时,我们不是在让它写故事。我们是在让它扮演一个管理者。 大脑是如何被下达指令的 要把一个 LLM 变成智能体管理者,开发者会写一个"系统提示词"(System Prompt)。这是一套用户永远看不到的隐藏指令。它精确告诉 AI 它的工作是什么,以及必须遵守什么规则。 下面是一个智能体系统提示词的简化示例: 你是 ByteBuilders 的客户支持智能体。 你的目标是解决客户工单请求。 你可以使用一个名为 "Check_Order_Status" 的工具。 你可以使用一个名为 "Issue_Refund" 的工具。 不要猜答案。用你的工具去查明事实。 在采取任何行动之前,一步步思考。 当用户说"我的包裹在哪?",LLM 读取系统提示词,读取用户的问题,然后用它的逻辑判断:"在回复之前,我大概应该先用 Check_Order_Status 工具。" LLM 是推理引擎。它做决定。但如果不能对一个决定采取行动,这个决定就毫无用处,这就把我们带到了下一根支柱。 3. 支柱二:工具(给 AI 双手) 如果说 LLM 是大脑,那么工具就是双手。这是 AI 与外界交互的方式。 一个工具(有时称为函数 Function 或插件 Plugin)就是一段执行特定任务的传统计算机代码。开发者写这些工具,并把它们连接到 LLM 上。 AI 如何使用一个工具 这是通常让初学者困惑的部分。AI 是怎么"点击"按钮或者"运行"一个工具的?它没有物理的鼠标或键盘。 这一切都通过文本发生。具体来说,通过一种叫做 JSON(JavaScript Object Notation)的结构化文本格式发生。 让我们看一个分步示例,看看 AI 是如何使用一个天气工具的: 第 1 步:请求 用户输入:"今天在西雅图我需要带伞吗?" 第 2 步:AI 决定使用一个工具 LLM 想了想,意识到它不知道实时天气。但它知道它有一个 "Weather_Tool"。LLM 不再用文本答案回复用户,而是输出一个看起来像这样的特殊代码块: { "tool_name": "Weather_Tool", "location": "Seattle, WA" } 第 3 步:软件拦截代码 包裹 LLM 的软件架构看到这段特殊的 JSON 代码。它阻止 LLM 对用户说话。软件取出位置("Seattle, WA"),把它传给互联网上真实的天气 API。 第 4 步:工具返回数据 真实的天气 API 查询预报,把原始数据返回给软件。 结果:大雨。55 华氏度。 第 5 步:AI 拿到数据并回复 软件把这个结果交还给 LLM。现在 LLM 读取结果,终于对用户说话:"是的,今天在西雅图你绝对需要带伞。现在正在下雨,55 华氏度。" 在用户看来,AI 像是神奇地搜索了网络。但在架构上,AI 只是输出了一段格式化的文本请求,环绕它的软件运行了工具,然后把结果喂回 AI 的大脑。 工具可以是任何东西。一个智能体可以有一个搜索 Google 的工具、一个运行计算器的工具、一个发 Slack 消息的工具,或者一个删除文件的工具。唯一的限制,就是开发者决定给它哪些工具。 4. 支柱三:记忆(给 AI 一个记事本) 如果你长时间使用过一个标准的 AI 聊天机器人,你大概注意到了一个令人沮丧的缺陷:它会忘事。如果你周一告诉它你的狗叫什么,它周五就不会记得了。 LLM 没有持久记忆。每当你开始一段新对话,它们都会带着失忆症醒来。 一个自主智能体要真正有用,它需要记得它五分钟前做了什么,也需要记得它五周前做了什么。Agentic 架构通过把记忆拆成两种截然不同的类型来解决这个问题:短期记忆和长期记忆。 短期记忆(草稿纸) 短期记忆就像书桌上的一张草稿纸。当一个智能体在解决一个复杂问题时,它需要一个地方写下中间步骤。 想象你让一个智能体调研三台不同的笔记本电脑,并推荐最好的一台。 智能体搜索了笔记本 A,拿到了规格。它不能在搜索笔记本 B 的时候把那些规格一直记在脑子里。于是,架构提供了一个"草稿纸"——一个临时文本文件,智能体可以在里面写下笔记。 智能体写下:"给自己记一条:笔记本 A 有 16GB 内存,售价 $1000。" 它在任务进行期间,把这张草稿纸放在自己的上下文窗口里。一旦做出最终推荐、任务完成,这张草稿纸就被丢进垃圾桶。 长期记忆(文件柜) 长期记忆是智能体跨越几天、几周、几个月记住事实的方式。 因为我们无法把数百万个词一次性塞进 LLM 活跃的大脑,我们使用一个外部数据库(通常称为向量数据库 Vector Database)。你可以把它想象成一个巨大的金属文件柜。 当用户告诉智能体"我最喜欢的编程语言是 Python",智能体把这条事实写在一张纸上,放进文件柜存档。 下个月,当用户问"你能写一个脚本来整理我的文件吗?",智能体先打开文件柜,搜索任何与用户偏好相关的事实,抽出那张写着"偏好 Python"的纸,然后用 Python 写代码。 这个在生成答案之前从数据库里取事实的过程,叫做 RAG(检索增强生成,Retrieval-Augmented Generation)。它是赋予 AI 长期记忆的骨干。 5. 支柱四:规划引擎(智能体循环) 我们有了大脑,有了双手,有了记忆。现在我们需要那个驱动它们前进的引擎。我们需要智能体循环(Agentic Loop)。 标准聊天机器人按直线工作:用户提问 -> AI 生成答案 -> 停止。 自主智能体按圆圈工作。它们使用一个叫做 ReAct(推理与行动,Reasoning and Acting)的框架。智能体不再只是立刻回答,而是进入一个"思考、行动、观察结果"的持续循环。 "思考 - 行动 - 观察"循环 让我们看一个真实世界的场景,看看这个循环如何运作。 你给智能体一个提示词:"查一下谁赢得了 2026 年超级碗,以及最终比分是多少。" 以下是智能体循环内部精确发生的事: 循环 1: 思考:"用户想要 2026 年超级碗的冠军和比分。我的训练数据里没有这个信息。我需要用我的 Web_Search 工具去查。" 行动:[用查询"2026 Super Bowl winner final score"运行 Web_Search 工具] 观察:搜索工具返回了一篇文章片段:"2026 年超级碗是一场激动人心的比赛。堪萨斯城酋长队击败了旧金山 49 人队。" 循环 2: 思考:"搜索结果告诉我酋长队赢了,但它没有给我最终比分。我的目标还没达成。我需要专门再搜一次比分。" 行动:[用查询"Chiefs vs 49ers 2026 Super Bowl final score"运行 Web_Search 工具] 观察:搜索工具返回了一条体育快讯:"最终比分:酋长队 31,49 人队 27。" 循环 3: 思考:"我现在有了冠军(酋长队)和最终比分(31-27)。我已经有了满足用户请求所需的全部信息。我现在输出最终答案。" 行动:回复用户:"堪萨斯城酋长队以 31 比 27 的最终比分赢得了 2026 年超级碗。" 观察:任务完成。循环终止。 这个循环就是让 AI"自主"的原因。你不需要牵着它的手。当它第一次搜索没能得到完整答案时,它意识到了自己的失误,自我纠正,然后再试一次。它不停地在这个循环里转,直到目标达成。 6. 护栏与安全(监督者) 当初学者了解到智能体循环时,他们通常都会立刻冒出同一个念头:"如果循环永远卡住怎么办?或者如果它做了什么危险的事怎么办?" 这是一个非常合理的担忧。如果你通过一个 API 工具给了智能体你公司的信用卡访问权,你可不想它卡在循环里,趁你睡觉时意外买下 500 张机票。 为了防止这种情况,Agentic 架构包含一个关键的安全层,称为 Harness(套具)或 Guardrails(护栏)。 最大轮数(断路器) 最简单的护栏是循环上限。开发者硬编码一条规则进软件:"这个智能体永远不允许循环超过 10 次。" 如果智能体搜索网络 10 次,还是找不到超级碗比分,软件介入,切断电源,强制智能体说:"抱歉,我试了 10 次,但没能找到答案。"这能防止 AI 烧掉昂贵的云计算账单。 人在环中(批准按钮) 对于危险动作,我们使用"人在环中"(Human-in-the-Loop)架构。 如果你给一个智能体一个叫 Delete_Database 的工具,架构不会让智能体随意运行那个工具。当 LLM 输出触发删除的 JSON 代码时,软件暂停循环。它向人类用户发一条消息:"智能体想删除数据库。你批准吗?" 智能体保持冻结,直到人类点击"是"或"否"。AI 有自主权去调研和规划,但人类对破坏性动作保留最终的否决权。 7. 演进:多智能体蜂群 随着开发者对构建单个智能体越来越得心应手,他们意识到了另一个问题。如果你给一个智能体 50 个不同的工具(邮件、写代码、图像生成、数据库管理),它会变得困惑。系统提示词变成十页长,AI 很难记住它确切的角色。 2026 年的前沿趋势,是从单个智能体转向多智能体蜂群(Multi-Agent Swarms)。 开发者不再用一个"上帝智能体"试图包办一切,而是构建高度专业化微型智能体的团队。 智能体 A(研究员)只有网络搜索工具。 智能体 B(写手)没有工具,但被重重指令要求写优美的散文。 智能体 C(编辑)有检查语法和核实事实的工具。 当你让系统写一篇博客文章时,一个管理者智能体(Manager Agent)接收你的请求,把它交给研究员。研究员完成后,把笔记交给写手。写手起草文章,交给编辑。 它们的工作方式,就像一支人类企业团队。通过让每个智能体的工作保持小而聚焦,整个系统的可靠性直线飙升。 8. 把一切拼起来:一个简单的代码概念 为了证明你不需要成为火箭科学家也能理解这些,让我们看一些极度简化的伪代码。这不是真实可运行的 Python,但它完美地展示了包裹 LLM 的那套架构到底有多简单。 # 第 1 步:定义智能体可以使用的工具 available_tools = [Web_Search_Tool, Calculator_Tool] # 第 2 步:设定目标 user_goal = "Find the population of France and multiply it by 2." # 第 3 步:启动智能体循环 loop_count = 0 while loop_count < 5: # 断路器护栏 # 让大脑思考目标和当前观察 ai_thought = LLM.think(user_goal, current_observations) # AI 是否决定它需要使用一个工具? if ai_thought.wants_to_use_tool(): tool_name = ai_thought.get_tool_name() # 软件运行工具(双手) result = run_tool(tool_name) # 保存结果,好让 AI 下次能读到它(记忆) current_observations.add(result) # AI 是否决定它有了最终答案? elif ai_thought.has_final_answer(): print("Final Answer: " + ai_thought.get_answer()) break # 退出循环! loop_count += 1 如你所见,复杂的地方不是代码。复杂的地方是 LLM 内部的逻辑。架构只是一个标准的 while 循环,它给 LLM 一个思考的机会,触发 LLM 请求的工具,然后把结果喂回去,直到工作完成。 10. 运行智能体的经济学 初学者从聊天机器人转向 Agentic 架构时,面临的最大障碍之一是理解成本。当你在 ChatGPT 里输入一个问题,你发送了一个提示词,得到一个答案。那次计算的开销是零点几美分。 但让我们想想前面讨论过的智能体循环。 如果一个智能体必须循环五次才能找到最终的超级碗比分,它不是只对 LLM 做一次 API 调用。它做五次。而且在大多数智能体架构里,智能体必须在每一轮都读取它草稿纸的整个历史,以免丢失上下文。 第 1 轮:智能体读取系统提示词和用户目标。(500 词) 第 2 轮:智能体读取系统提示词、用户目标,以及搜索 1 的结果。(800 词) 第 3 轮:智能体读取系统提示词、用户目标、搜索 1 的结果,以及搜索 2 的结果。(1200 词) 上下文窗口在每一轮都变得越来越大。这意味着一个智能体任务在时间和云计算费用上,都比一次简单的聊天机器人查询贵出指数级。 为什么小模型很重要 这个经济现实,驱动了开发者选择智能体"大脑"方式的巨大转变。2024 年,所有人都试图在循环的每一步都用大规模的前沿模型(比如 GPT-4)。 如今,聪明的架构使用"模型路由"(Model Routing)。 如果智能体只需要格式化一个日期,或者从一个搜索结果里提取单个关键词,架构就把那个具体步骤路由到一个高效的小语言模型(SLM),运行起来几乎不花钱。系统把昂贵的大规模 LLM 留出来,只用于需要深度推理的复杂规划步骤。 理解这种切分——知道何时用大而贵的脑子、何时用便宜而快的脑子——是一个资深 AI 架构师的标志。这正是你构建出"在现实世界里真正跑得起"的自主系统的方式。 9. 从"你使用的软件"到"替你干活的软件"的转变 理解 Agentic 架构至关重要,因为它代表了我们与计算机关系的根本性转变。 过去四十年,软件一直是"思想的自行车"。它是一个需要人类操作者去踩踏的工具。除非你写公式,Microsoft Excel 不会计算数据。除非你输入 URL,网页浏览器不会找到信息。 Agentic AI 把软件变成了一辆自动驾驶汽车。你不再需要踩踏板。你只需提供目的地。 通过用记忆、工具和规划循环包裹语言模型,我们正在创造数字实习生。它们能接收模糊的目标,把它拆成可执行的步骤,从错误中恢复,并交付成品。 聊天框时代正在终结。数字劳动力时代已经开始。我们不再只是跟 AI 对话。我们在向它委派任务。而那些懂得如何编排这些智能体的公司和个人,将定义下一个十年的技术。 订阅 ByteBuilders,在收件箱里获取下一篇深度拆解:https://bytebuilders.beehiiv.com/subscribe 标签:# X # AI # Loops # Guide # Chatgpt 相关文章 How to Build an AI-Native Company: Hiring, Standards, and Cadence *We spent a year running hackathons, AI trainings, and office hours. But nothing changed until we made AI capability a requirement.* AI Loops Claude Marketing

原文参考:https://maxed.wiki/posts/agentic-ai-architecture-explained-from-llms-to-autonomous-agents/ (Maxed.wiki,本页为站内中文整理)