AI大模型训练范式解析:预训练与后训练的双轨演进

  • 来源:东吴证券
  • 发布时间:2026/08/03
  • 浏览次数:13
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度10期,预训练与后训练如何塑造大模型?.pdf

大模型训练范式正经历从两阶段到多阶段的演进重构。预训练与后训练作为理解模型能力形成的关键框架,前者以海量低成本数据自监督学习形成通用底座,决定能力上限;后者以少量高质量数据适配人类意图,决定调用方式与任务表现。当前产业分歧聚焦于能力来源归属、三阶段划分趋势,以及规模化重心是否从预训练转向后训练与推理时计算。预训练的核心机制与约束预训练以"预测下一个词"等自监督目标为核心,扩展律揭示了参数量、数据量与算力的幂律关系,但高质量公共文本预计在2028年前后接近供给上限,推动产业向数据质量优化、合成数据及多模态扩展转向。后训练的方法演进与局限后训练涵盖监督微调、RLHF、DPO、RLVR等路径,从习得...

预训练与后训练:底座形成与使用适配

预训练与后训练共同构成大模型能力形成与产品化适配的核心链条。预训练在海量数据上以自监督方式学习通用表征,形成能力底座;后训练则面向人类意图、推理任务和使用边界进行适配,使模型从具备潜在能力转向可稳定调用。预训练利用海量低成本、弱标注或无标注数据学习通用底座,决定能力来源和上限;后训练利用少量高质量指令、偏好、反馈或可验证奖励数据进行适配,决定能力的调用方式、指令遵循、偏好对齐及特定任务中的推理表现。

从功能分工看,预训练侧重于知识、语法、模式和多模态关联的广泛吸收,使模型具备通用表达与生成基础;后训练侧重于将既有能力约束到可交互、可控和可评估的产品形态,使模型能够按指令回应、遵守安全边界并输出符合任务要求的结果。这一"通用底座形成—使用场景适配"的两阶段范式,是理解数字AI与物理AI训练流程的主线框架。

术语溯源与本质区别

预训练源于2006年的深度学习突破,本义是"逐层无监督初始化"。2015—2018年,迁移学习路线赋予其今日含义,确立了"大规模数据自监督学习通用模型、再进行任务适配"的范式。后训练在ChatGPT之后成为更通用的阶段性口径,InstructGPT确立预训练、监督微调(SFT)、基于人类反馈的强化学习(RLHF)三阶段流程后,业界逐步将预训练之后、面向使用适配的训练环节统称为post-training,外延覆盖SFT、RLHF、RLAIF、DPO直至RLVR。

预训练与后训练在数据、学习目标、信号来源、作用及规模特征上存在四维分工。预训练使用海量、低成本、无标注数据,以自监督学习为主,数据自身提供信号,形成通用底座,算力需求极大、周期长;后训练使用少量、高成本、高质量数据,模仿人类示范、对齐偏好或优化可验证奖励,由人类或环境提供信号,形成可用产品,算力需求小、迭代快,对效果的边际撬动显著。

当前主要分歧:三条主线

当前分歧主要集中在三条主线:其一,能力主要来自预训练还是后训练,即表层对齐假说与强化学习可带来新能力两类观点的交锋;其二,训练流程应保持两阶段划分,还是扩展为预训练、中训练、后训练三阶段;其三,规模化投入的重心是否正从预训练转向后训练与推理时计算。现阶段,后训练与推理时计算的重要性提升在语言、数学、代码等可验证任务中体现更充分。

预训练:通用能力底座如何形成

预训练的主力目标是自监督学习,即以数据内部结构作为监督信号,无需人工标注。典型路线包括预测下一个词,即根据上文预测后续词元;BERT路线则采用掩码还原,即还原被遮挡的词元。预测下一个词这一目标迫使模型在海量文本中学习语法、事实、常识和部分推理模式,进而成为通用能力的重要来源。

扩展律用公式刻画规模与性能之间的关系。Kaplan等发现模型损失随参数量、数据量和算力增加呈幂律下降,意味着三者按一定比例扩大时,性能可沿相对可预测的曲线改善。Hoffmann等通过更系统的实验加以校正,提出参数与数据应大体等比例扩大的计算最优经验,意味着不少早期大模型存在参数偏大、数据偏少的问题。

数据约束方面,可便捷获取的高质量公共文本将在约2028年基本用尽,早期估计为2026年。应对路径包括:从追求更多数据转向追求更高质量数据、合成数据、向多模态扩展,以及将增量投入移向后训练与推理时计算。

后训练:从基座可用到对齐与推理增强

监督微调以人工编写的指令—回答示范为训练数据,使模型学习按指令作答、按预期格式输出,这是InstructGPT三阶段流程的第一步。预训练得到的基座模型主要顺着上文续写,并不天然具备稳定的指令遵循能力。

RLHF的现代形态由Christiano等在2017年确立,流程是先让人类比较模型不同输出的质量,据此训练奖励模型,再用强化学习优化模型。其标志性结果是,仅约900比特的人类反馈,就让仿真机器人学会了连续动作后空翻。宪法AI使用一组人工制定的原则作为"宪法",让模型自我评判并自动生成反馈,是后训练降本的重要路线。

直接偏好优化证明可绕过"训练奖励模型+PPO强化学习"的复杂流程,直接用偏好数据优化模型,训练更稳定、占用算力更少、也更不易出现"奖励欺骗",已成为对齐的主流替代方案之一。

可验证奖励的强化学习(RLVR)以可自动判定的奖励训练推理,当奖励可被自动验证时,例如数学题、代码可直接判定对错,无需人工逐一评分,即可大规模开展强化学习。代表性实践采用GRPO,甚至跳过监督微调、仅以强化学习便涌现出自我反思与验证等长链推理行为。

后训练的主要局限包括对齐税与奖励欺骗:对齐有时会牺牲部分原有能力;当模型学会迎合奖励信号而非完成真实任务时,会出现奖励欺骗。

阶段过渡:中训练与推理时计算正在重塑边界

中训练介于预训练与后训练之间,使用大规模无标注数据,但配以更聚焦的训练目标用于系统增强复杂能力并为后训练做准备。数据退火是指逐步降低学习率以稳定收敛,部分模型将其视为多语言与长上下文整合阶段。

推理时计算指模型在回答时生成更多推理token、进行更长步骤的中间推演,以推理侧算力换取更高准确率。最优地分配推理时计算,在许多任务上比单纯扩大参数更有效。纯强化学习可使模型在推理阶段生成更长的中间过程。

思维链指模型在给出最终答案前,先输出中间推理步骤,再形成结论。思维链本身不是一个训练阶段,而是一种可在推理时呈现、可在后训练中被强化的行为模式,横跨预训练、后训练与推理三处。模型能够输出有条理的推理步骤,源于预训练语料中包含大量分步推理文本;只需在提示中给出分步示范或一句引导语,即可在推理阶段触发该能力。进一步用强化学习让模型无需提示便生成更长、更有效的思维链,把推理行为从提示诱发转向默认输出,这种长思维链正是推理时计算的具体形式,由此成为连接后训练与推理时计算的关键机制。

数字AI与物理AI:同一框架,不同数据和反馈

物理AI的代表性模型已明确沿用大语言模型训练配方。机器人基座模型被官方描述为预训练后接后训练、对标大语言模型范式;自动驾驶VLA模型则采用驾驶数据模态注入、因果链数据监督微调、强化学习后训练的多阶段流程。

但两者在数据、反馈信号和核心瓶颈上存在明显差异:预训练数据不同,数字AI以文本中的预测下一个词为主,物理AI更多复用视觉-语言骨干,并在跨本体动作与驾驶视频上继续训练;后训练反馈信号不同,数字AI侧重人类偏好,物理AI侧重物理世界奖励、动作模仿与安全约束;核心瓶颈不同,数字AI面对公共数据接近上限,物理AI面对真机交互数据稀缺。

机器人领域从视觉-语言模型之上联合微调机器人轨迹数据与网络图文数据,并把动作表示为文本token。后续模型以视觉-语言模型为骨干,预训练阶段使用逾万小时、覆盖多类机器人多项任务的数据并叠加开源数据集,再以高质量数据后训练,采用流匹配方法生成连续动作轨迹。机器人领域的核心分歧之一,是动作应表示为离散token还是连续数值。

自动驾驶方面,端到端框架将感知、预测、规划统一进一个可微分的框架。世界模型用自回归Transformer加扩散解码生成未来驾驶视频,常被置于训练、仿真、评估和策略改进基础设施一侧。部分方案将大语言模型配方移植到车端:先进行大规模驾驶数据模态注入与预训练,再通过因果链数据监督微调习得推理,最后以强化学习后训练优化轨迹安全与推理-动作一致性。

物理AI的核心瓶颈在于真机数据的稀缺。即便开源数据集汇集了百万级轨迹,相对文本语料仍属小数据;高质量真机数据稀缺且昂贵,遥操作采集既慢又易出错,成为部署与扩充数据的实际瓶颈。数据来源分化出三条路线:海量人类操作视频、真机采集、仿真。

产业与投资视角:成本与价值的迁移

随着基座模型成熟、商用部署铺开,AI的成本重心在多个数字AI场景中从训练转向推理。训练是一次性固定投入,推理则是被高频调用的持续边际成本。业界估计,主要厂商的推理算力占比已过半。具备推理能力的模型既要生成更多token、又要更快响应,叠加后对算力的需求可达约百倍。

预训练是资本开支密集的规模竞赛,数据与算力门槛高,由少数基座厂商主导;后训练则是以较小增量投入提升模型可用性和推理能力的效率竞赛。代表性实践采用GRPO并跳过监督微调,以远低于同类的成本逼近同级推理,并可将能力蒸馏迁移到更小规模。在数据接近上限、预训练边际收益趋缓的预期下,后训练与推理效率正成为新的增长极与差异化来源。

中国头部厂商更多在后训练算法与推理效率上发力,围绕推理模型、强化学习与能力蒸馏形成代表性样本;多家厂商也密集迭代推理模型,部分公开口径称在国产算力平台训练。整体看,国内厂商更多以后训练与推理优化换取性价比。

数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,应重点关注。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至