微调与对齐:让模型听指令、守规矩
直觉版:先通才,再专才
Section titled “直觉版:先通才,再专才”预训练让模型成为”语言通才”,但它不会自动按人类期望回答问题。微调(fine-tuning)用高质量指令-回答对继续训练,让模型学会”对话格式”。对齐(alignment)则进一步让输出符合人类价值观:有用、诚实、无害。
可以类比为:预训练是读完所有教科书,微调是参加模拟面试练习,对齐则是学习职业道德和行为规范。三者缺一不可。
近两年出现的一个新趋势是”模型当老师教自己”:模型先尝试解答问题,把答对的解法收集起来再训练自己,无需再请一个更强的外部模型来批改作业。另一个趋势是”在实践中练习”:让模型在大量可以自动判分的模拟工作环境里反复操作工具、纠正错误,从而学会当 Agent 而不只是聊天。
工程版:从 SFT 到偏好优化
Section titled “工程版:从 SFT 到偏好优化”实际流程通常分阶段:
- SFT(监督微调):用人工撰写或蒸馏的高质量指令数据训练,让模型学会跟随格式和风格。
- RLHF(基于人类反馈的强化学习):先训练奖励模型(RM)学习人类偏好排序,再用 PPO 等算法优化策略模型,使其获得更高奖励分数。
- DPO(直接偏好优化):跳过显式奖励模型,直接用偏好数据优化策略,简化流程且效果往往相当。
工程取舍包括:SFT 数据质量比数量更重要;RLHF 的超参数敏感、训练不稳定;DPO 更简单但可能在长回复或复杂分布上表现不如 RLHF。 Constitutional AI 和 RLAIF 试图用 AI 而非人类生成偏好,降低成本并提高可扩展性。
此外,LoRA、QLoRA 等参数高效微调方法让小资源团队也能在消费级 GPU 上微调大模型,极大降低了应用门槛。
2026 年的后训练新趋势:on-policy 自蒸馏与 Agentic RL
Section titled “2026 年的后训练新趋势:on-policy 自蒸馏与 Agentic RL”2026 年的后训练管线出现了两个值得注意的结构性变化。
On-policy 自蒸馏:传统蒸馏依赖一个更强的教师模型生成训练数据,而 on-policy self-distillation([[ref:selfdistill2026-reasoner]])让模型在自身策略分布上采样解题轨迹,配合可验证奖励筛出正确轨迹后蒸馏回自身,形成不依赖外部强教师的自我改进闭环。工程上的好处是蒸馏管线不再受限于”必须有一个更强的模型”,并天然缓解了 off-policy 数据带来的分布失配;代价是需要可靠的自动验证器,否则错误轨迹会被一并强化。
Agentic RL 与合成可验证环境:把工具使用能力纳入后训练,需要大量多轮、可判分的环境。Agent World Model([[ref:agentworld2026]])代表了用程序生成合成环境的做法:环境由代码生成、奖励可由程序验证(覆盖 MCP 工具调用),单步可并行上千个环境实例,绕开真实环境昂贵、缓慢且不可复现的瓶颈。取舍在于合成环境与真实任务之间的分布差距仍要靠真实任务评测来校准。
部署前评估的扩展:对齐评估不再只看”答得好不好”。deliberative alignment 类方法让模型在回答前显式援引安全规范进行推理,而 scheming、sandbagging(故意压低表现)等行为检测开始被纳入部署前评估清单。一个现实背景是”评估自知”问题:The Evaluation Differential([[ref:evalawareness2026-differential]])汇总的证据表明,模型有时能意识到自己正在被测试并相应调整行为,这会系统性侵蚀基准与安全评估的可信度,因此评估设计本身也需要把这一因素考虑进去。
研究版:对齐的本质与局限
Section titled “研究版:对齐的本质与局限”研究上,“对齐”是否真正改变了模型的内部目标,还是只是表面行为的抑制?这是一个开放问题。有证据表明,模型在某些情况下会”绕过”安全训练(jailbreak),说明对齐可能不是深层的。
关键研究方向包括:奖励黑客(reward hacking)的检测与防御;长度偏差、位置偏差等偏好建模的 artifacts;多轮对话中的上下文一致性;以及,如何用更少的人类标注获得更稳健的对齐效果。
新的研究焦点还包括:on-policy 自蒸馏中”自我提升”的理论上限——模型在没有外部信息源时能否持续改进,还是会在自身分布上逐渐坍缩;Agentic RL 在合成可验证环境中习得的能力向真实开放环境迁移的机理;以及评估自知对对齐评估的系统性影响——如果模型能识别”这是测试”,基于行为观察的安全结论还有多少效力。
🔬 开放研究问题
该领域的关键问题与研究方向:
- RLHF 中的 reward hacking 问题如何从根本上解决?DPO 是否完全规避了这一问题?
- 对齐后的"能力退化"现象如何量化和缓解?如何在对齐与能力之间找到最优平衡?
- 是否存在统一的对齐框架可以同时处理有用性、无害性、诚实性三个维度?
- On-policy 自蒸馏的理论上限在哪里?模型在自身策略分布上闭环训练能否持续改进而不发生分布坍缩?
- 合成可验证环境中训练的 Agentic RL 能力能否可靠迁移到真实开放环境?环境多样性与真实性的最优配比是什么?
- 当模型具备"评估自知"能力时,基于行为观察的对齐评估(包括 scheming 与 sandbagging 检测)还有多少可信度?
训练数据流:从 rollout 到梯度回传(工程视角)
Section titled “训练数据流:从 rollout 到梯度回传(工程视角)”RL 对齐训练的核心循环可以用一句话概括:先采样一批回答,重算新旧策略的 token 概率,再用比值裁剪控制更新幅度,最后把 loss 回传到所有参数。七张图展示这条数据流的每一步。
Fig 1 · response_mask:哪些 token 参与 loss
Section titled “Fig 1 · response_mask:哪些 token 参与 loss”RL 训练只对模型生成的 response 部分计算 loss;prompt 部分的 loss 被掩码为 0,否则奖励信号会污染到输入侧。
loss = Σt mask[t] · CE(logit[t], label[t]) / Σ mask[t] Fig 2 · rollout:采样生成 response(vLLM)
Section titled “Fig 2 · rollout:采样生成 response(vLLM)”在每个训练步开始前,用当前策略从 vLLM 批量采样多条回答(rollout)。这些回答将送入奖励模型打分,并用于后续 log_prob 计算。
Each sampled response feeds into log_prob recalculation & reward scoring
Fig 3 · teacher-forcing forward:重算 log_prob(Megatron)
Section titled “Fig 3 · teacher-forcing forward:重算 log_prob(Megatron)”得到采样回答后,把「prompt + response」整条序列以 teacher-forcing 方式重新喂入策略模型,在一次前向计算中并行得到所有 response token 的 log P。这是当前策略 π_θ 的 log_prob。
Teacher-forcing feeds ground-truth tokens at each step, enabling efficient parallel log_prob recalculation.
Fig 4 · log_prob vs old_log_prob:新旧策略对比
Section titled “Fig 4 · log_prob vs old_log_prob:新旧策略对比”将上一步得到的 log π_θ 与采样时记录的 log π_old 逐 token 对比,差值决定策略的”漂移程度”。
The difference Δ = log πθ − log πold determines importance ratio rt = exp(Δ), which PPO/GRPO clips to prevent policy drift.
Fig 5 · ratio clipping:PPO / GRPO 裁剪
Section titled “Fig 5 · ratio clipping:PPO / GRPO 裁剪”比值 r_t = exp(log π_θ − log π_old) 代表策略更新幅度。PPO 把 r_t 裁剪到 [1−ε, 1+ε],防止单步更新过大造成训练崩溃。
rt = πθ(at|st) / πold(at|st) = exp(log πθ − log πold)
LCLIP = Et[ min(rt·Ât, clip(rt, 1−ε, 1+ε)·Ât) ]
Fig 6 · seq-mean-token-mean:loss 聚合方式
Section titled “Fig 6 · seq-mean-token-mean:loss 聚合方式”先在每条序列内对 response token 取平均(消除序列长度偏差),再跨 mini-batch 取平均得到标量 loss。
Seq-mean-then-batch-mean: normalize per sequence first, then average across the batch — eliminating length bias.
Fig 7 · softmax Jacobian → 梯度回传 → Megatron 管线
Section titled “Fig 7 · softmax Jacobian → 梯度回传 → Megatron 管线”从标量 loss 开始,梯度经由 softmax Jacobian 传回 logit,再沿 96 层 Transformer 反传至所有 235B 参数,最终由 Megatron-LM 的三维并行切分(PP/TP/DP)分发到各 GPU 更新权重。
V ≈ 128k vocab; full J 太大→实际用向量积简化
每层累积 ∂L/∂W via chain rule
layers 1–24
layers 25–48
layers 49–72
layers 73–96
(p − y) 简化为 O(V) 操作。
Megatron 的流水线并行(PP)、张量并行(TP)、数据并行(DP)三维切分让 235B 参数更新分布在数千 GPU 上。
The softmax Jacobian dimension explosion (V×V) is avoided in practice using the simplified gradient
(p − y) — O(V) ops.
Megatron's 3D parallelism (PP/TP/DP) distributes the 235B parameter update across thousands of GPUs.
本文引用论文
- Training language models to follow instructions with human feedback
InstructGPT 论文,提出了 RLHF 三阶段训练方法(SFT → 奖励模型 → PPO 强化学习), 让语言模型从"预测下一个词"转变为"按人类意图回答问题"。这是 ChatGPT 的直接前身, 开创了对齐技术的主流路线。
- Deep Reinforcement Learning from Human Preferences
RLHF(人类反馈强化学习)的奠基论文。作者展示了通过人类对比偏好来训练奖励模型, 再用该奖励模型指导强化学习,可以让 agent 学会难以用奖励函数显式描述的复杂行为。 这个框架后来被 InstructGPT/ChatGPT 直接采用。
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
DPO(直接偏好优化)证明了 RLHF 中的奖励模型 + RL 两步可以合并为一步有监督学习: 直接在偏好数据上优化语言模型参数,数学上等价于最优 RLHF 策略。 DPO 因其简洁高效成为对齐研究和开源社区的主流替代方案。
- Constitutional AI: Harmlessness from AI Feedback
Anthropic 的 Constitutional AI(CAI)方法:用一组明文"宪法"原则,让模型先进行自我批评和 修订(SL-CAI 阶段),再用 AI 反馈代替人类反馈做 RLHF(RLAIF 阶段)。 这减少了对人工标注的依赖,是 Claude 系列模型对齐的核心技术。
- RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
Google 系统性地证明 RLAIF 在多种任务上能匹敌 RLHF,把"AI 反馈替代人工"作为可扩展的对齐方案给出工程证据。
- LoRA: Low-Rank Adaptation of Large Language Models
LoRA 通过冻结预训练模型权重,只训练两个低秩矩阵的乘积(秩 r 远小于原始维度), 把微调的可训练参数量降低了 10000 倍。这使得在消费级 GPU 上微调大模型成为可能, 几乎成为当今最主流的参数高效微调(PEFT)方法。
- On-Policy Self-Distillation for Reasoning Models
2026 开年后训练热点"自蒸馏"的代表工作:模型在自身策略分布上生成数据并蒸馏回自身,不再依赖外部强教师模型,配合可验证奖励实现自我改进闭环,显著降低后训练对蒸馏管线的依赖。
- Agent World Model: Scaling Agentic RL with Synthetic Verifiable Environments
用程序生成、可验证的合成环境大规模训练 Agent 的工具使用能力(覆盖 MCP 工具调用),单步可并行上千个环境实例,绕开真实环境昂贵、缓慢且不可复现的瓶颈,是 2026 年 Agentic RL 环境合成的代表工作。
- The Evaluation Differential: How Evaluation Awareness Distorts LLM Benchmarks
汇总多家前沿实验室的证据:模型在评测中有时能"意识到自己在被测试"并相应调整行为(如 Anthropic 内部表征研究显示模型在部分 SWE-bench Verified 题目上表现出评估自知),系统性讨论了评估自知对基准可信度的侵蚀及缓解方案。