一句话摘要
解析 LLM 背后的五阶段工作流程
你所用过的每一个 LLM 背后的五阶段流水线 —— 完整指南 July 15, 2026 · 21 min read · View source ↗ AI Claude Marketing Hardware
每次你给 Claude、GPT 或任何其他大语言模型输入一条消息,你都是在和一个五阶段流水线的输出说话,那条流水线花了几个月、有时几年、以及数千万到数亿美元来构建。
在 AI 实验室之外,几乎没人真正理解这五个阶段。大多数解释要么用你不需要的数学淹死你,要么对 "training" 挥手了事,好像它是单个步骤。它不是。它是五个不同的阶段,每个解决一个不同的问题,每个都能以它自己特有的方式失败,而且每个都解释了为什么你面前这个模型会这样表现的一个不同部分。
这是完整的拆解。到最后你会确切理解 "一堆互联网文本" 和 "一个能进行对话的模型" 之间发生了什么,以及为什么一个行为来自哪个阶段,会精确告诉你如果出问题时该如何修复。
为什么这很重要,即使你永远不训练一个模型
你不需要理解这条流水线就能把 Claude 或 GPT 用好。但你需要它来理解为什么这些模型会这样表现,而那个理解会改变你如何和它们一起工作。
当一个模型幻觉一个事实时,那是一种不同于它拒绝一个合理请求的失败,而这又不同于它给出一个技术上正确但没帮助的回答。这些失败中的每一个都能追溯到这条流水线里的一个不同阶段。知道哪个阶段产生了某个给定行为,能告诉你更好的提示是否能修好它,还是你撞上了一个在你打开聊天窗口几个月前就已烘烤进去的限制。
而且这越来越是一份直接带来收入的知识。微调开放模型、构建评估系统、设计训练流水线,都是眼下 AI 工程里薪酬最高的专精方向之一,而每一个那样的工作都建立在下述五个阶段之上。
阶段 1:数据收集和预处理
每个 LLM 都始于一份食谱,而那份食谱几乎决定了模型最终的性格、知识和盲点的全部。
原材料是巨大的。Common Crawl,一个对互联网公共部分很大一块的持续更新抓取,Wikipedia,数字化的书籍,代码仓库,科学论文,论坛讨论,以及越来越多实验室直接付费购买的、来自出版商和专业来源的授权数据。今天的 frontier 模型在大约数万亿 tokens 的量级上训练,一个 token 在英语里平均大约是一个词的四分之三。
收集数据是容易的部分。真正的工作发生在接下来,而这里就是大多数人对 "AI 训练" 的心智模型完全错误的地方。实验室不只是把原始互联网倒进模型里。他们先把它过一遍激进的过滤和清洗流水线。
去重移除近乎相同的内容,因为同一篇爆款文章被复制到五百个网站上,不应该被计五百次,既为了效率,也因为有可测量地证明,过采样重复内容会降低模型质量。质量过滤移除低价值内容、垃圾、自动生成的 SEO 页面、破损文本,使用基于规则的启发式,以及越来越多专门训练来给文本质量打分的小型分类器模型。毒性和安全过滤移除互联网上最糟的部分、那些如果被包含会主动伤害模型行为的极端内容,尽管一个受控量的困难内容也很重要,因为一个从未见过争论的模型无法帮你应对一场争论。
刻意的构成混合是几乎没人公开谈论的那部分,而它是整条流水线里影响最深远的决定之一。实验室不是按数据在互联网上自然存在的比例来训练。代码相对其自然频率被上调,因为代码教会结构化的、逻辑的推理模式,以一种研究者最初没有预料到的方式迁移到非代码任务。高质量的科技和科学写作被上调。某些语言基于战略优先级被上调或下调。
这个阶段是模型最终性格的很大一部分在单个训练步骤运行之前就被设定的地方。一个不成比例地在 Reddit 讨论上训练的模型,和一个不成比例地在正式科技写作上训练的模型,会有不同的性格,即便之后发生了任何微调。
这个阶段导致的失败模式。如果一个模型持续缺少某个特定领域的知识,给出关于某个会变化的东西的过时信息,或表现出一种跨不相关主题出现的奇怪文风小癖好,那往往是一个数据阶段的问题,不是提示能有意义地修复的。你无法靠提示绕过从未在训练集里的信息。
阶段 2:预训练
这是大多数人说 "训练一个 LLM" 时所指的阶段,而且它是整条流水线里计算上最昂贵、超出其他部分一个巨大数量级的部分,往往占据总训练成本的绝大部分。
这个任务的表述简单到有欺骗性。给定一个 token 序列,预测下一个。那就是全部目标。喂给模型 "The capital of France is",它应该学会以高概率预测 "Paris"。跨数万亿 tokens 做这件事,每一批调整数十亿或数万亿内部参数,然后发生了非凡的事。为了在一个真正多样的数据集上擅长预测下一个 token,模型必须发展出语法、事实、推理模式、甚至某种像世界模型一样的内部表征,因为在巨量上下文里准确预测下一个 token,需要真正理解正在被描述的东西。
底下的架构是 Transformer,2017 年引入,它的关键创新是注意力机制。注意力让模型在处理任何给定 token 时,能权衡上下文里每一个其他 token 的相关性,而不是像旧架构那样严格从左到右处理文本、带着逐渐衰退的记忆。这就是为什么一个 LLM 能正确解析 "it" 指的是几个段落之前提到的那个名词——这在注意力出现之前是一个真正困难的问题。
预训练跑在巨大集群上,几千块专用芯片、GPU、或像 Google TPU 那样的定制硅,并行运行数周到数月。这里的工程挑战不只是有足够算力,而是保持几千块芯片同步、在一次可能持续数月的运行中优雅处理硬件故障、以及在参数比任何单块芯片能装下的都多的模型上管理内存。
单独预训练的结果,就是所谓的一个 base model。它知识极其渊博,能以异常复杂的方式补全文本,但它还不是你会称之为助手的东西。一个原始 base model,用问题提示它,就和你回答它一样可能继续用更多问题续接你的问题,因为它被训练来预测文本的合理续写,而不是要有帮助。这是没构建过模型的人对 LLM 最被误解的事实。让 Claude 或 GPT 感觉像一个乐于助人的助手的东西,不是预训练。是之后发生的一切。
这个阶段导致的失败模式。知识截止直接来自这里,一个模型只了解直到它预训练数据被收集的那个时间点的世界。某些推理弱点,特别是围绕训练数据里代表性很差的真正新颖问题类型,也追溯到这个阶段,而任何巧妙的提示都无法完全补偿 base model 基础能力里的一个缺口。
阶段 3:监督式微调
这是 base model 开始变成助手的地方,而机制远没有大多数人以为的那么复杂。
研究者和受雇的标注员写出几千个示例对话,精确展示一个乐于助人、诚实的助手应该对巨量多样的提示给出怎样的回应。一个关于如何修一个 bug 的问题得到一个清晰、结构化的回答。一个有害请求得到一个礼貌的拒绝。一个模糊问题得到一个澄清式回应,而不是一个猜测。在现代流水线里,越来越多地,有能力的现有模型被用来生成这些示例的很大一部分,这种技术常被称为蒸馏,由人类审核和整理结果,而不是从零写每个示例。
然后模型在这个精心整理的数据集上微调,使用和预训练相同的底层下一 token 预测机制,只是在一个小得多、质量高得多、整理得刻意得多的示例集上。这比预训练便宜和快得多,有时花几天而不是几个月,因为模型不再从零学习语言和知识了。它已经从预训练拥有了那一切。它是在学习一个特定的行为模式,如何格式化有帮助的回应,叠加在它已经拥有的知识之上。
这是模型助手性格真正被构建的阶段。它是逐步解释推理、还是一步跳到结论?它是在请求模糊时问澄清问题、还是做它最好的猜测然后继续?它默认用解释性注释格式化代码吗?这些行为默认值里的每一个,都是整理 SFT 数据集的人类做出的刻意决定,不是 base model 的涌现属性。
这个阶段导致的失败模式。如果一个模型持续以你觉得没帮助的方式格式化东西、把简单的东西过度解释、或把复杂的东西解释不足,那个行为默认值就是在这里被设定的。这也是,值得注意的是,好提示确实能覆盖默认值的一个阶段,因为你是在要求模型偏离一个学到的模式,而不是要求它知道某件它从未被教过的事。
阶段 4:来自人类反馈的强化学习
这是把语言模型从 "技术上乐于助人的助手" 带到人们日常使用的真正有用、对齐的系统的那一步,而且它也是和前三个阶段概念上最不同的。
RLHF 解决的核心问题是这个。SFT 教一个模型模仿示例回应,但模仿有一个天花板。一个纯粹在模仿上训练的模型,只能和它的示例一样好,而且没有机制让它超越那个、或学习那些难以通过示例演示、但当你把两个选项并排看时很容易识别的微妙偏好。
RLHF 把方法从模仿翻转到偏好。人类评分者,或越来越多一个专门训练来建模人类偏好的 AI 系统,被展示同一提示的两个或更多回应,并简单说明哪个更好。这比从零写一个完美示例容易得多,而且结果它能扩展到远更大的反馈量。
这些偏好判断训练一个单独的模型,叫 reward model,它全部的工作就是学会预测人类会偏好两个回应里的哪一个。一旦那个 reward model 足够好,真正的语言模型就再次被微调,这次用强化学习,生成回应、被 reward model 打分、并在很多轮迭代里调整以产生更高分的回应。实际上,这个模型是在和一个模拟的人类评估者练习数百万次,而用真人在那个规模做这件事是彻底不切实际的。
Anthropic 特别开创了一个叫 Constitutional AI 的变体,其中一套书面原则引导一个 AI 系统批判和修订它自己的输出,减少所需人类标注的绝对量,同时依然产生一个反映一套选定、可检验价值观的对齐信号,而不是匿名评分者偏好的一个不透明聚合。
这也是对模型安全行为、它拒绝有害请求的倾向、在真正不确定的论断上打折扣、避免自信地陈述它其实不知道的事,最负责的阶段。而且它,值得注意的是,也是最可能产生研究者称之为 sycophancy 的那个特定失败的阶段——一个模型学到评分者倾向于偏好附和、认可式的回应,并过度优化成告诉人们他们想听的话,而不是准确的东西。把这个阶段做对,既避开一个过度限制的模型、又避开一个过度附和的模型,是眼下整个领域里最难的一个开放问题。
这个阶段导致的失败模式。对合理请求过度谨慎的拒绝、在模型其实很清楚的事情上过度打折扣的倾向、以及对用户自信陈述的一个错误前提的谄媚式同意,都追溯到这个阶段,具体到 reward model 是如何训练的、以及它学到了去奖励什么。
阶段 5:部署和推理优化
模型现在存在了。这个最后阶段是基础设施团队之外几乎没人想的那个,而它是一个在论文里奏效的模型、和一个能同时服务几百万人在几秒而不是几分钟内回应的模型之间的区别。
一个 frontier 模型在它原始训练形态下可能巨大,有时几百 GB 的参数。对每一个请求原样运行它在任何真实规模上都慢得和贵得令人望而却步。这个阶段的存在就是为了解决那个问题,而不在有意义地牺牲前四个阶段取得的品质。
量化降低用于存储模型参数的数值精度,从一个高精度格式降到更低精度格式,极大地缩小模型的内存足迹并加速计算,带着一个精心管理的、通常很小的品质权衡。蒸馏,在这个语境下和上面 SFT 用法略有不同的含义,涉及训练一个更小、更快的模型去模仿一个更大的模型的行为,产生像 Haiku 这样的模型,用一些原始能力换取极大降低的成本和延迟,对那些不需要 frontier 级推理的很大一部分现实世界任务有用。缓存跨共享共同前缀的请求存储并复用计算,这正是你在当前 API 定价里看到的陡峭 prompt caching 折扣背后的机制。批处理在同样的硬件上同时处理多个请求,极大提高一个给定芯片集群每秒能服务的请求数。
这个阶段也是实际产品体验被构建的地方。逐个 token 流式地返回回应、而不是让你等整个回应完成,是一个推理阶段的工程决定,不是训练决定。工具使用,调用外部函数、搜索网页、或执行代码的能力,也是在这个阶段接线的,检索增强生成也一样,其中相关文档在模型生成回应之前被取来并插入模型的上下文,把它有效的知识扩展到预训练期间冻结进去的之外。
这个阶段导致的失败模式。延迟、成本和可用性问题完全住在这里。一个模型在 "fast" 或 "lite" 称号下给出明显比它完整版更差的回答,往往是一个刻意的蒸馏权衡,而不是一套完全不同的训练流水线。而当一个有知识截止的模型正确回答一个关于非常近期事件的问题时,是这个阶段的检索机制在做工作,而不是 base model 以某种方式知道它训练数据结束之后的事。
把五个阶段放在一起
这是完整流水线的顺序,以及为什么顺序重要。
数据收集和预处理决定了模型可能知道或反映什么,在单个训练步骤运行之前。预训练通过大规模下一 token 预测把那个原材料变成一个知识渊博但无方向的 base model。监督式微调通过整理好的示例教那个 base model 乐于助人的助手行为的具体形状。来自人类反馈的强化学习用偏好信号进一步精炼那个行为,达到单独模仿学习无法达到的规模,并主要对模型的安全和对齐特性负责。部署和推理优化拿完成的模型,让它快到、负担得起、可扩展到足以真正作为一个产品服务。
每个阶段只能修复前一个阶段使之可能的东西。再多的 RLHF 也教不会一个模型一个它从未在预训练里遇到过的事实。再多的巧妙微调也救不了一个量化糟糕的部署的快。再多的基础设施优化也修不好一个你关心的领域里 base 训练数据稀薄的模型。理解一个给定行为追溯到哪个阶段,是区分一个能诊断模型为什么这样表现的人、和一个只是瞎猜更好的提示并寄望的人的东西。
为什么理解这个会改变你如何使用这些模型
一旦你真的看清这五个阶段,日常使用 LLM 的几件事就不再神秘。
为什么有时换个说法问同样的问题,会产生一个截然不同的答案?因为你是在和 SFT 和 RLHF 层互动,它们从相似请求的特定措辞里学到了模式,而措辞的微小变化能切换哪个学到的模式被激活。
为什么模型有时自信地陈述虚假的东西?因为预训练优化的是文本的合理续写,而不是被验证的真相,而且虽然 RLHF 用力压自信的谬误,它无法完全消除一个在最根本训练目标里烘烤进去的倾向。
为什么模型有时拒绝某些完全合理的东西?因为 RLHF 阶段训练了一个 reward model 在某些请求类别上偏好谨慎,而 reward model 和任何模型一样,偶尔会把一个真正无害的请求误分类成它学会要谨慎的某个类别。
为什么一个 "更小" 或 "更快" 版本的模型在困难推理任务上明显更差,但在简单任务上几乎一样好?因为那个模型在部署阶段经过了一个蒸馏过程,专门设计来保留最常需要的能力,同时舍弃更贵、更不常需要的推理深度。
这些都不是对模型的批评。这只是用这五个不同的、不完美的阶段构建智能,实际产生的东西,而知道这条流水线,会把每一个这样的行为从一个令人困惑的怪癖变成一个可解释、可预测的模式。
不同实验室实际如何分道扬镳
上述五个阶段是一个共享骨架,但每个实验室在那个骨架里做的具体选择,是真正竞争差异显现的地方,而理解那些差异,解释了为什么不同模型用起来确实感觉不同,远超原始基准分数。
一些实验室不成比例地投资数据阶段,构建更大、更激进整理的自有数据集,直接从出版商授权内容,而不是纯粹依赖开放网页抓取,押注数据质量比流水线里任何其他单一杠杆都更能复利。另一些不成比例地投资规模,构建更大的模型和更大的训练集群,押注原始参数数量和算力、应用在一个足够好的数据集上,会赢。
RLHF 阶段是实验室之间的哲学差异在实际产品行为里最可见的地方。一个在 reward model 里重度加权安全和谨慎的实验室,产出一个明显更保守的助手,更可能拒绝模糊请求、更可能对不确定论断打折扣。一个更重加权原始帮助性和直接性的实验室,产出一个更主动、更少打折扣的模型,在边缘情况上以一些谨慎为代价。两种方法都不是客观上正确的,它们代表对哪种失败模式更糟的不同押注——一个偶尔过于谨慎的助手,还是一个偶尔过于放纵的助手,而不同实验室的理性人在那个权衡上落到不同位置。
部署阶段是日常里产品最可见的差异显现的地方。上下文窗口的大小和构成、一个实验室对它较小模型的蒸馏有多激进、工具使用和检索如何被集成,所有这些都是部署阶段的决定,塑造了一个模型实际构建起来感觉如何,独立于底层模型的原始预训练能力。
这值得内化,因为它意味着纯粹在单一基准数字上比较模型,错过了大部分真实故事。两个模型可以在一个标准评估上得分相似,而在实践中表现完全不同,因为基准很好地衡量了阶段一到阶段三的能力,却几乎说不出任何关于最能影响一个模型日常使用感觉的 RLHF 驱动行为倾向、或部署阶段工程。
这条流水线里现在正在改变什么
上述五阶段模型描述了过去几年 frontier 模型是如何被构建的,但流水线本身在积极演化,而且值得知道当前的压力点在哪里。
合成数据在每一个阶段都扮演越来越大的角色,不只是 SFT。随着公共互联网最高质量的部分被更彻底地开采,实验室越来越多地用现有有能力的模型生成训练数据,然后过滤和整理那个合成输出,而不是纯粹依赖人类创作的内容。这提出了关于天花板效应的真实、正在被积极辩论的问题:一个重度在另一个模型输出上训练的模型,能否有意义地超过老师模型自己的能力,还是这种方法大多只是转移和压缩现有能力、而不是创造真正的新能力。
阶段三和阶段四之间的界线在模糊。像 Direct Preference Optimization 这样的新技术相当程度地简化了 RLHF 流水线,让一个模型直接从前后的偏好对学习,而不需要训练和维护一个完全独立的 reward model,把曾经更复杂的两步过程折叠成更接近单次训练运行的东西。这已经让 RLHF 式对齐对没有 frontier 实验室资源的团队来说,有意义地更可及了。
Test-time compute,这个想法是一个模型可以在它回答问题的那个时刻被给予更多计算,在回应之前想得更久更仔细,而不是只通过事先的额外训练变聪明,已经作为一个真正的新杠杆出现,部分坐在阶段五里,部分作为全新的东西。这是当前 frontier 模型里 extended reasoning 和 effort-level 设置背后的机制,而且它代表了实验室边际研究投入方向的一次真实转变,从纯粹把预训练做大,转向让推理本身更聪明、更审慎。
Agentic 能力,那些做计划、用工具、自主执行多步任务的模型,越来越作为贯穿每一个阶段的一个自有考量被训练,而不是纯粹当作部署阶段、螺栓式接在一个已完成模型上的集成。数据整理现在专门包含 agentic 轨迹和工具使用示例。RLHF 越来越多奖励好的过程,而不只是好的最终答案,因为一个通过不可靠或无根据的推理达到正确答案的模型,在 agentic 语境里是一个负资产,即便最终输出恰好是对的。
这些都不改变上述基本的五阶段骨架。它改变每个阶段如何被执行,而理解那个骨架,恰恰是让你能随着这些变化发生时跟上它们的东西,而不是把每个新技术体验成一个叠加在已无法解释的流水线之上的无法解释的黑箱。
这个所解锁的实际技能
如果上面五个阶段里有任何一个听起来有趣到值得专精,这里是一份诚实的、关于每个阶段里真正可雇佣的技能住在哪里的地图。
LLM 的数据工程意味着构建和运行那些把原始抓取数据变成训练就绪数据集的过滤、去重和质量分类流水线,一个坐在大规模数据工程和机器学习判断交叉点上的学科。
预训练工程是五个里最专门、最小的就业市场,需要深厚的分布式系统专业知识,几乎完全集中在少数几个真正从零训练 frontier 规模模型的实验室内部。
微调和 RLHF 目前是给来自扎实软件工程背景、没有研究博士的人、需求最大、最可及的专精方向之一,因为这里发生了巨量实用的、应用型工作,把现有 base model 适配到特定领域和用例。
评估和对齐工作,构建那些衡量一个模型是否真的按预期行为的测试套件和 reward model,是一个越来越关键、薪酬越来越好的专精方向,因为一个没有被严格评估的模型,在生产规模上是一个真正的负资产。
推理和部署工程是经典基础设施和系统工程技能与机器学习相遇的地方,在规模上优化服务成本、延迟和可靠性,而它是一门直接从通用高性能系统工程经验迁移过来的学科。
挑一个匹配你已经觉得有趣的阶段,去在里面构建点东西。一个在特定领域微调一个开放模型、或为一个你在乎的任务构建一个真正评估 harness 的小项目,展示对这条流水线的真正理解,是读它永远达不到的方式。
五个阶段不是五个独立的谜。它们是一条连贯的流水线,而一旦你能看清全部五个,你互动的每一个模型就不再是一个黑箱,而开始变成一个你真的能推理的系统。
关注 @cyrilXBT 获取更多像这样的深度技术拆解。Tags: # X # AI # Claude # Marketing # Hardware # Growth # Guide # Rag Related articles OpenClaw: The Personal AI Agent That Went Viral in January and Nobody Explained How to Set It Up OpenClaw: The Personal AI Agent That Went Viral in January and Nobody Explained How to Set It Up AI Marketing Claude Hardware
原文参考:https://maxed.wiki/posts/the-5-stage-pipeline-behind-every-llm-you-have-ever-used-full-guide/ (Maxed.wiki,本页为站内中文整理)