一句话摘要
解析从 LLM 到自主智能体的架构
Agentic AI 架构详解:从 LLM 到自主智能体
2026 年 8 月 27 日 · 17 分钟阅读 · 查看原文 ↗
AI 循环(Loops)
如果你刚刚踏入人工智能的世界,你大概已经注意到,人们谈论 AI 的方式发生了一次巨大的转变。一年前,所有人都痴迷于"聊天机器人"。你在一个框里输入问题,AI 输入一个答案作为回应。那很神奇,但它也是被动的。AI 只在你跟它说话时才工作。
如今,整个科技行业已经转向了一个新的痴迷:Agentic AI(智能体式 AI)。
我们不再构建只会跟你说话的软件,而是在构建为你工作的软件。想象一下,你想调研一个竞争对手的定价。用聊天机器人,你得自己上网搜索、复制文字、粘贴到聊天窗口里,然后让 AI 总结它。而用一个 AI Agent(智能体),你只需要说:"找到我的前三个竞争对手,读他们的定价页面,把摘要存到一个电子表格里。"这个智能体会前往互联网,点击链接,读取数据,格式化电子表格,做完之后给你发消息。
但一个聊天机器人是怎么突然长出"手"来的?一个生成文本的 AI,是怎么学会浏览网页、点击按钮的?
在这份面向初学者的指南里,我们将拆解 Agentic AI 的架构。我们会打开引擎盖,精确解释开发者是如何把一个简单的大语言模型(LLM)变成一个完全自主的数字员工的。我们会拆解四个核心组件:大脑(Brain)、记忆(Memory)、工具(Tools)和规划循环(Planning Loop)。
你不需要一个计算机科学学位就能理解这些。读完这篇文章,你将精确理解软件的未来是如何被构建的。
1. 最大的区别:LLM 与 Agent
在深入架构之前,我们需要先厘清初学者最大的困惑点:LLM 和 Agent 之间有什么区别?
罐子里的大脑
把一个大型语言模型(比如 GPT-4 或 Claude)想象成一个漂浮在玻璃罐里的聪明大脑。
这个大脑几乎读完了互联网上的每一本书、每一篇文章和每一个代码库。它聪明得不可思议。如果你问它一个问题,它能给你一个精彩的答案。但因为它被困在罐子里,它什么也做不了。它发不了邮件。它读不了实时网页。它查不了你的日历。它完全与外界隔绝。
有身体的大脑
一个 AI Agent,就是那个一模一样的大脑,只不过被从罐子里拿出来,放进了一个机器人的身体里。
底层智能完全一样——Agent 仍然用 LLM 来思考。但开发者写了环绕它的软件,给了这个大脑机械臂(工具 Tools)、一个用来记事的记事本(记忆 Memory),以及一套关于如何达成目标的指令(规划循环 The Planning Loop)。
LLM 生成文本。Agent 生成行动。
这就是我们所说的"Agentic 架构"。我们谈论的,是包裹在语言模型周围、赋予它在数字世界里行动能力(agency)的那套软件结构。让我们拆解这个架构的四大支柱。
2. 支柱一:大脑(语言模型)
每一个 AI Agent 正中心的,是大脑。也就是那个大语言模型。
在传统的聊天机器人里,我们用 LLM 写诗、起草邮件、解释复杂话题。但在 Agentic 架构里,我们把 LLM 用于一个完全不同的目的:逻辑与路由。
当一个 LLM 作为智能体的大脑工作时,我们不是在让它写故事。我们是在让它扮演一个管理者。
大脑是如何被下达指令的
要把一个 LLM 变成智能体管理者,开发者会写一个"系统提示词"(System Prompt)。这是一套用户永远看不到的隐藏指令。它精确告诉 AI 它的工作是什么,以及必须遵守什么规则。
下面是一个智能体系统提示词的简化示例:
你是 ByteBuilders 的客户支持智能体。
你的目标是解决客户工单请求。
你可以使用一个名为 "Check_Order_Status" 的工具。
你可以使用一个名为 "Issue_Refund" 的工具。
不要猜答案。用你的工具去查明事实。
在采取任何行动之前,一步步思考。
当用户说"我的包裹在哪?",LLM 读取系统提示词,读取用户的问题,然后用它的逻辑判断:"在回复之前,我大概应该先用 Check_Order_Status 工具。"
LLM 是推理引擎。它做决定。但如果不能对一个决定采取行动,这个决定就毫无用处,这就把我们带到了下一根支柱。
3. 支柱二:工具(给 AI 双手)
如果说 LLM 是大脑,那么工具就是双手。这是 AI 与外界交互的方式。
一个工具(有时称为函数 Function 或插件 Plugin)就是一段执行特定任务的传统计算机代码。开发者写这些工具,并把它们连接到 LLM 上。
AI 如何使用一个工具
这是通常让初学者困惑的部分。AI 是怎么"点击"按钮或者"运行"一个工具的?它没有物理的鼠标或键盘。
这一切都通过文本发生。具体来说,通过一种叫做 JSON(JavaScript Object Notation)的结构化文本格式发生。
让我们看一个分步示例,看看 AI 是如何使用一个天气工具的:
第 1 步:请求
用户输入:"今天在西雅图我需要带伞吗?"
第 2 步:AI 决定使用一个工具
LLM 想了想,意识到它不知道实时天气。但它知道它有一个 "Weather_Tool"。LLM 不再用文本答案回复用户,而是输出一个看起来像这样的特殊代码块:
{
"tool_name": "Weather_Tool",
"location": "Seattle, WA"
}
第 3 步:软件拦截代码
包裹 LLM 的软件架构看到这段特殊的 JSON 代码。它阻止 LLM 对用户说话。软件取出位置("Seattle, WA"),把它传给互联网上真实的天气 API。
第 4 步:工具返回数据
真实的天气 API 查询预报,把原始数据返回给软件。
结果:大雨。55 华氏度。
第 5 步:AI 拿到数据并回复
软件把这个结果交还给 LLM。现在 LLM 读取结果,终于对用户说话:"是的,今天在西雅图你绝对需要带伞。现在正在下雨,55 华氏度。"
在用户看来,AI 像是神奇地搜索了网络。但在架构上,AI 只是输出了一段格式化的文本请求,环绕它的软件运行了工具,然后把结果喂回 AI 的大脑。
工具可以是任何东西。一个智能体可以有一个搜索 Google 的工具、一个运行计算器的工具、一个发 Slack 消息的工具,或者一个删除文件的工具。唯一的限制,就是开发者决定给它哪些工具。
4. 支柱三:记忆(给 AI 一个记事本)
如果你长时间使用过一个标准的 AI 聊天机器人,你大概注意到了一个令人沮丧的缺陷:它会忘事。如果你周一告诉它你的狗叫什么,它周五就不会记得了。
LLM 没有持久记忆。每当你开始一段新对话,它们都会带着失忆症醒来。
一个自主智能体要真正有用,它需要记得它五分钟前做了什么,也需要记得它五周前做了什么。Agentic 架构通过把记忆拆成两种截然不同的类型来解决这个问题:短期记忆和长期记忆。
短期记忆(草稿纸)
短期记忆就像书桌上的一张草稿纸。当一个智能体在解决一个复杂问题时,它需要一个地方写下中间步骤。
想象你让一个智能体调研三台不同的笔记本电脑,并推荐最好的一台。
智能体搜索了笔记本 A,拿到了规格。它不能在搜索笔记本 B 的时候把那些规格一直记在脑子里。于是,架构提供了一个"草稿纸"——一个临时文本文件,智能体可以在里面写下笔记。
智能体写下:"给自己记一条:笔记本 A 有 16GB 内存,售价 $1000。"
它在任务进行期间,把这张草稿纸放在自己的上下文窗口里。一旦做出最终推荐、任务完成,这张草稿纸就被丢进垃圾桶。
长期记忆(文件柜)
长期记忆是智能体跨越几天、几周、几个月记住事实的方式。
因为我们无法把数百万个词一次性塞进 LLM 活跃的大脑,我们使用一个外部数据库(通常称为向量数据库 Vector Database)。你可以把它想象成一个巨大的金属文件柜。
当用户告诉智能体"我最喜欢的编程语言是 Python",智能体把这条事实写在一张纸上,放进文件柜存档。
下个月,当用户问"你能写一个脚本来整理我的文件吗?",智能体先打开文件柜,搜索任何与用户偏好相关的事实,抽出那张写着"偏好 Python"的纸,然后用 Python 写代码。
这个在生成答案之前从数据库里取事实的过程,叫做 RAG(检索增强生成,Retrieval-Augmented Generation)。它是赋予 AI 长期记忆的骨干。
5. 支柱四:规划引擎(智能体循环)
我们有了大脑,有了双手,有了记忆。现在我们需要那个驱动它们前进的引擎。我们需要智能体循环(Agentic Loop)。
标准聊天机器人按直线工作:用户提问 -> AI 生成答案 -> 停止。
自主智能体按圆圈工作。它们使用一个叫做 ReAct(推理与行动,Reasoning and Acting)的框架。智能体不再只是立刻回答,而是进入一个"思考、行动、观察结果"的持续循环。
"思考 - 行动 - 观察"循环
让我们看一个真实世界的场景,看看这个循环如何运作。
你给智能体一个提示词:"查一下谁赢得了 2026 年超级碗,以及最终比分是多少。"
以下是智能体循环内部精确发生的事:
循环 1:
思考:"用户想要 2026 年超级碗的冠军和比分。我的训练数据里没有这个信息。我需要用我的 Web_Search 工具去查。"
行动:[用查询"2026 Super Bowl winner final score"运行 Web_Search 工具]
观察:搜索工具返回了一篇文章片段:"2026 年超级碗是一场激动人心的比赛。堪萨斯城酋长队击败了旧金山 49 人队。"
循环 2:
思考:"搜索结果告诉我酋长队赢了,但它没有给我最终比分。我的目标还没达成。我需要专门再搜一次比分。"
行动:[用查询"Chiefs vs 49ers 2026 Super Bowl final score"运行 Web_Search 工具]
观察:搜索工具返回了一条体育快讯:"最终比分:酋长队 31,49 人队 27。"
循环 3:
思考:"我现在有了冠军(酋长队)和最终比分(31-27)。我已经有了满足用户请求所需的全部信息。我现在输出最终答案。"
行动:回复用户:"堪萨斯城酋长队以 31 比 27 的最终比分赢得了 2026 年超级碗。"
观察:任务完成。循环终止。
这个循环就是让 AI"自主"的原因。你不需要牵着它的手。当它第一次搜索没能得到完整答案时,它意识到了自己的失误,自我纠正,然后再试一次。它不停地在这个循环里转,直到目标达成。
6. 护栏与安全(监督者)
当初学者了解到智能体循环时,他们通常都会立刻冒出同一个念头:"如果循环永远卡住怎么办?或者如果它做了什么危险的事怎么办?"
这是一个非常合理的担忧。如果你通过一个 API 工具给了智能体你公司的信用卡访问权,你可不想它卡在循环里,趁你睡觉时意外买下 500 张机票。
为了防止这种情况,Agentic 架构包含一个关键的安全层,称为 Harness(套具)或 Guardrails(护栏)。
最大轮数(断路器)
最简单的护栏是循环上限。开发者硬编码一条规则进软件:"这个智能体永远不允许循环超过 10 次。"
如果智能体搜索网络 10 次,还是找不到超级碗比分,软件介入,切断电源,强制智能体说:"抱歉,我试了 10 次,但没能找到答案。"这能防止 AI 烧掉昂贵的云计算账单。
人在环中(批准按钮)
对于危险动作,我们使用"人在环中"(Human-in-the-Loop)架构。
如果你给一个智能体一个叫 Delete_Database 的工具,架构不会让智能体随意运行那个工具。当 LLM 输出触发删除的 JSON 代码时,软件暂停循环。它向人类用户发一条消息:"智能体想删除数据库。你批准吗?"
智能体保持冻结,直到人类点击"是"或"否"。AI 有自主权去调研和规划,但人类对破坏性动作保留最终的否决权。
7. 演进:多智能体蜂群
随着开发者对构建单个智能体越来越得心应手,他们意识到了另一个问题。如果你给一个智能体 50 个不同的工具(邮件、写代码、图像生成、数据库管理),它会变得困惑。系统提示词变成十页长,AI 很难记住它确切的角色。
2026 年的前沿趋势,是从单个智能体转向多智能体蜂群(Multi-Agent Swarms)。
开发者不再用一个"上帝智能体"试图包办一切,而是构建高度专业化微型智能体的团队。
智能体 A(研究员)只有网络搜索工具。
智能体 B(写手)没有工具,但被重重指令要求写优美的散文。
智能体 C(编辑)有检查语法和核实事实的工具。
当你让系统写一篇博客文章时,一个管理者智能体(Manager Agent)接收你的请求,把它交给研究员。研究员完成后,把笔记交给写手。写手起草文章,交给编辑。
它们的工作方式,就像一支人类企业团队。通过让每个智能体的工作保持小而聚焦,整个系统的可靠性直线飙升。
8. 把一切拼起来:一个简单的代码概念
为了证明你不需要成为火箭科学家也能理解这些,让我们看一些极度简化的伪代码。这不是真实可运行的 Python,但它完美地展示了包裹 LLM 的那套架构到底有多简单。
# 第 1 步:定义智能体可以使用的工具
available_tools = [Web_Search_Tool, Calculator_Tool]
# 第 2 步:设定目标
user_goal = "Find the population of France and multiply it by 2."
# 第 3 步:启动智能体循环
loop_count = 0
while loop_count < 5: # 断路器护栏
# 让大脑思考目标和当前观察
ai_thought = LLM.think(user_goal, current_observations)
# AI 是否决定它需要使用一个工具?
if ai_thought.wants_to_use_tool():
tool_name = ai_thought.get_tool_name()
# 软件运行工具(双手)
result = run_tool(tool_name)
# 保存结果,好让 AI 下次能读到它(记忆)
current_observations.add(result)
# AI 是否决定它有了最终答案?
elif ai_thought.has_final_answer():
print("Final Answer: " + ai_thought.get_answer())
break # 退出循环!
loop_count += 1
如你所见,复杂的地方不是代码。复杂的地方是 LLM 内部的逻辑。架构只是一个标准的 while 循环,它给 LLM 一个思考的机会,触发 LLM 请求的工具,然后把结果喂回去,直到工作完成。
10. 运行智能体的经济学
初学者从聊天机器人转向 Agentic 架构时,面临的最大障碍之一是理解成本。当你在 ChatGPT 里输入一个问题,你发送了一个提示词,得到一个答案。那次计算的开销是零点几美分。
但让我们想想前面讨论过的智能体循环。
如果一个智能体必须循环五次才能找到最终的超级碗比分,它不是只对 LLM 做一次 API 调用。它做五次。而且在大多数智能体架构里,智能体必须在每一轮都读取它草稿纸的整个历史,以免丢失上下文。
第 1 轮:智能体读取系统提示词和用户目标。(500 词)
第 2 轮:智能体读取系统提示词、用户目标,以及搜索 1 的结果。(800 词)
第 3 轮:智能体读取系统提示词、用户目标、搜索 1 的结果,以及搜索 2 的结果。(1200 词)
上下文窗口在每一轮都变得越来越大。这意味着一个智能体任务在时间和云计算费用上,都比一次简单的聊天机器人查询贵出指数级。
为什么小模型很重要
这个经济现实,驱动了开发者选择智能体"大脑"方式的巨大转变。2024 年,所有人都试图在循环的每一步都用大规模的前沿模型(比如 GPT-4)。
如今,聪明的架构使用"模型路由"(Model Routing)。
如果智能体只需要格式化一个日期,或者从一个搜索结果里提取单个关键词,架构就把那个具体步骤路由到一个高效的小语言模型(SLM),运行起来几乎不花钱。系统把昂贵的大规模 LLM 留出来,只用于需要深度推理的复杂规划步骤。
理解这种切分——知道何时用大而贵的脑子、何时用便宜而快的脑子——是一个资深 AI 架构师的标志。这正是你构建出"在现实世界里真正跑得起"的自主系统的方式。
9. 从"你使用的软件"到"替你干活的软件"的转变
理解 Agentic 架构至关重要,因为它代表了我们与计算机关系的根本性转变。
过去四十年,软件一直是"思想的自行车"。它是一个需要人类操作者去踩踏的工具。除非你写公式,Microsoft Excel 不会计算数据。除非你输入 URL,网页浏览器不会找到信息。
Agentic AI 把软件变成了一辆自动驾驶汽车。你不再需要踩踏板。你只需提供目的地。
通过用记忆、工具和规划循环包裹语言模型,我们正在创造数字实习生。它们能接收模糊的目标,把它拆成可执行的步骤,从错误中恢复,并交付成品。
聊天框时代正在终结。数字劳动力时代已经开始。我们不再只是跟 AI 对话。我们在向它委派任务。而那些懂得如何编排这些智能体的公司和个人,将定义下一个十年的技术。
订阅 ByteBuilders,在收件箱里获取下一篇深度拆解:https://bytebuilders.beehiiv.com/subscribe
标签:# X # AI # Loops # Guide # Chatgpt
相关文章
How to Build an AI-Native Company: Hiring, Standards, and Cadence
*We spent a year running hackathons, AI trainings, and office hours. But nothing changed until we made AI capability a requirement.*
AI Loops Claude Marketing
原文参考:https://maxed.wiki/posts/agentic-ai-architecture-explained-from-llms-to-autonomous-agents/ (Maxed.wiki,本页为站内中文整理)