论文综述:借小模型的RL经验教大模型——直接在策略蒸馏实现弱到强泛化
Weak-to-Strong Generalization via Direct On-Policy Distillation
📄 查看原文 →一、论文是干什么的?
现在最先进的推理大模型(比如做数学题很强的模型)大多是靠强化学习(RL)训练出来的。但RL训练有个大麻烦:模型越大,每一次「让模型自己生成答案、再根据答案对错打分调整」消耗的算力就越多、成本就越高——这跟人做题快慢无关,纯粹是因为模型参数越多,每算一步要做的计算量就越大。这就好比一家公司想反复做模拟测试再根据结果调整方案:请一位时薪很高的资深专家来做这件事,每天反复试错、反复请人批改反馈,成本很高;换成让一位时薪较低的初级新人来做同样的反复试错和批改,单位时间的成本就低得多。
于是研究者们想了一个取巧的办法:能不能先让一个便宜的小模型去做RL训练,把它从「训练前」到「训练后」学到的经验总结出来,再想办法「灌输」给一个更强的大模型,而不用在大模型上重新跑一遍昂贵的RL?这就是本文要解决的核心问题——如何把小模型RL训练中学到的东西,低成本地迁移给大模型,让大模型也变强,这被称为「弱到强泛化」(weak-to-strong generalization)。
一个自然的想法是直接让大模型模仿小模型RL训练后的最终行为(这叫「蒸馏」,distillation),但作者发现这样做效果有限,因为小模型RL训练后的最终策略里,混杂了「RL学到的有用改进」和「小模型本身能力不足留下的缺陷」,直接模仿等于把缺陷也一起学过来了。本文提出的方法能够把「RL到底改变了什么」这个纯粹的改进信号提取出来,再单独教给大模型。
二、核心方法与创新
论文提出的方法叫 Direct-OPD(Direct On-Policy Distillation,直接在策略蒸馏)。要理解它,可以打一个比方:
假设有个学生(小模型)在参加高考培训班前后各做过一次模拟考。培训前的答题习惯记作”参考策略”,培训后的答题习惯记作”训练后策略”。把这两次答题习惯的差异提取出来(比如”以前遇到这类题倾向选A,现在倾向选B”),这个差异本身就代表了培训班到底教了什么。作者证明,在带KL正则化的RL理论下,训练后策略和参考策略的对数概率之比(log-ratio),恰好就等价于(相差一个正比例常数和与题目相关的偏移量)RL训练时用来打分的那个隐藏奖励函数。换句话说,不需要知道RL当时具体用了什么奖励函数,只要对比”培训前后”的两个模型,就能反推出一份”奖励信号”。
这里说的”策略”(、)并不是某一个固定的向量,而是同一个小模型在两个不同训练阶段的权重快照所代表的”给任意上下文打分/选词的整套规则”: 是RL训练开始之前的那份权重(也就是常说的参考模型), 是用同一套RL算法把权重更新到训练结束之后的那份权重。喂给它某个具体的上下文,它才会通过 Transformer 最后一层算出的 logits 做一次 softmax,退化成一个词表大小的概率向量;而对一整段回答 算 ,做法是用”teacher forcing”把 和 整个拼起来走一遍前向传播,把 里每一个词在对应位置上的对数概率加总起来。这个计算方式意味着,不管 是谁写的、用了什么措辞,只要有题目 和这段回答文本,就能分别喂给”训练前”和”训练后”两份权重各算一遍对数概率。
具体来说:
- 设 为小模型RL训练后的策略, 为其RL训练前的参考策略,二者的对数概率差
被当作一个”稠密的隐式奖励”(每个词元都能打分,而不是像常规RL那样只有整句话结束才给一个稀疏奖励)。
- 大模型(学生)的训练目标变成:在自己生成的答案上,最大化这个隐式奖励的期望,同时用KL散度约束自己不要偏离原本的初始策略太远:
-
这个句子级的目标可以拆解到每个词元(token)上,得到逐词元的即时奖励 ,再结合策略梯度方法(Rao-Blackwell化的方法+仅关注概率最高的top-k个候选词)转化为可训练的损失函数。
-
为了让不同的师生模型组合都能稳定训练,作者还设计了一个自适应KL系数调整机制:根据当前批次的平均隐式奖励是正是负,动态调整KL约束的强弱,防止学生模型”用力过猛”或”学不到东西”。
这个方法最巧妙的地方在于:训练时真正被采样、被优化的分布 始终是学生自己当前的策略——学生用自己的措辞、自己的表达习惯写出一段回答,再把这段学生自己写的话喂给老师”训练前”和”训练后”两份权重各算一遍对数概率、相减,得到这段话该拿多少奖励。老师全程不需要自己生成过这段文字,也不需要学生的用词和老师有任何重合,只是被当作一个”隔空打分器”:如果学生表现出的行为倾向恰好是老师被RL纠正过来的那种(比如先验证条件再套公式), 就是正的,学生会被强化;如果学生某处的做法正是老师RL训练前后都没变化的部分, 就接近零,也就不会被当作”改进”传递过去。这样一来,它学的不是老师具体说了什么话、用了哪些词,而是”RL训练把哪些行为变得更好”这个抽象的改进方向,即使学生模型本身的表达习惯和老师完全不同(词汇分布重叠很低),依然能学到进步方向,这就是论文强调的”在完全在策略(on-policy)的状态下进行知识迁移”,避免了传统蒸馏方法要求师生模型输出高度重合才有效的限制。
三、使用了哪些模型和计算资源?
教师模型(小模型,先做RL训练产生”策略变化”信号):
- R1-Distill-1.5B → 训练后变为 JustRL-1.5B
- Nemotron-1.5B → 训练后变为 QuestA-Nemotron-1.5B
学生模型(接受迁移信号的更强模型):
- R1-Distill-7B
- Qwen3-1.7B
- Qwen3-4B
计算资源:
- Direct-OPD 迁移训练:8 张 A100 GPU
- 小模型RL基线训练(R1-Distill-1.5B):32 张 A100 GPU
- 大模型直接RL训练(7B模型):32 张 A100 GPU
代码基于经过修改(patched)的 verl 框架实现。
每次训练/实验耗费的时间:
| 实验 | 资源配置 | 耗时 |
|---|---|---|
| Direct-OPD 迁移训练(让大模型学习小模型的RL经验) | 8×A100 | 约4小时 |
| 小模型直接RL训练(1.5B模型,1500步) | 32×A100 | 约160小时 |
| 大模型直接RL训练(7B模型) | 32×A100 | 约320小时 |
可以看出,Direct-OPD 的迁移训练比在大模型上直接跑一遍RL要快得多(4小时 vs 320小时左右),这正是本文方法的核心卖点:用极低的成本获得接近甚至优于直接RL的收益。
(核实说明:以上4小时/160小时/320小时的数字经查证与原文一致,原文原句为:“a 1500-step RL run on R1-Distill-1.5B takes about 160 hours on 32 A100 GPUs, while RL on R1-Distill-7B takes about 320 hours. After small-model RL, the Direct-OPD transfer stage adds only about 4 hours on 8 A100 GPUs.”,出自论文正文第4.2节附近、Figure 3说明之后的计算量对比段落。)
四、实验结果
主要结果集中在数学推理基准 AIME 2024 / AIME 2025 上(AIME是美国高中生数学竞赛,常用来衡量大模型的数学推理能力):
| 学生模型 | 评测集 | 迁移前 | 迁移后(+Direct-OPD) | 提升 |
|---|---|---|---|---|
| Qwen3-1.7B | AIME 2024 | 48.3% | 58.3% | +10.0% |
| Qwen3-1.7B | AIME 2025 | 36.8% | 43.2% | +6.4% |
| Qwen3-4B | AIME 2024 | 72.5% | 77.6% | +5.1% |
| R1-Distill-7B | AIME 2024 | 56.7% | 63.1% | +6.4% |
| R1-Distill-7B | AIME 2025 | 40.5% | 48.8% | +8.3% |
其他关键发现:
- 换一套训练数据得到的迁移信号(QuestA teacher)依然能给 Qwen3-1.7B 在 AIME 2024 上带来 +10.7% 的提升,说明信号具有一定的跨数据泛化性。
- 在相同RL训练步数下,“小模型RL+迁移”的效果能追平甚至超过”直接在大模型上跑RL”,也就是说花小钱办了大事。
- 多次叠加有效:连续应用两次独立的策略迁移信号,AIME 2024 分数从48.3%一路提升到58.3%再到63.8%,说明改进信号可以像”打补丁”一样叠加使用。
- 消融实验发现:用短序列(2048 token)训练出的迁移信号,可以泛化到更长的生成序列上;但固定的KL约束强度不是万能的,不同的师生模型组合需要不同的KL强度,因此才需要前面提到的自适应KL机制。
论文也坦诚指出局限性:如果教师模型在学生模型实际会遇到的状态(states)上并没有实质性的改进,这个方法就可能失效;此外,最佳的训练序列长度和KL约束强度目前仍需要针对不同的师生模型组合分别调试,尚无普适的默认值。
五、潜在应用与已落地应用
潜在应用场景:
- 大幅降低大模型RL后训练(post-training)成本:企业可以先用小模型做实验性RL调优,再把改进”移植”到线上大模型,无需重复烧算力。
- 多次叠加不同来源的策略改进信号,实现”模块化”能力提升,类似于给大模型不断打各种能力补丁。
- 为资源有限的研究团队提供了参与前沿RL研究的低成本路径。
已落地/开源情况:
- 项目主页:bytedtsinghua-sia.github.io/Direct-OPD
- 代码仓库(Apache-2.0协议开源):github.com/BytedTsinghua-SIA/Direct-OPD,包含 JustRL-to-Qwen 实验的完整训练代码,基于修改版的 verl 框架
- 模型权重与相关产物发布在 Hugging Face 合集:huggingface.co/collections/BytedTsinghua-SIA/direct-opd
六、网络上的讨论与评价
该论文在 Hugging Face Papers 页面获得了129个点赞,说明在AI研究社区有较高关注度。搜索发现该论文有在X(前Twitter)上的转发讨论(如 x.com/Memoirs 的相关帖子),以及在 alphaXiv 上有对应的音频/讨论页面(alphaxiv.org)。另外有开发者维护的”awesome-on-policy-distillation”资源列表(github.com/chrisliu298/awesome-on-policy-distillation)收录了这篇论文,说明它已被归入”在策略蒸馏”这一细分技术方向的代表性工作之一。除此之外,暂未搜索到Reddit等论坛的专门讨论帖,也暂无主流科技媒体的深度报道,整体讨论目前主要集中在学术/开发者圈层,尚未看到大规模破圈讨论。
七、思维导图
mindmap
root((Direct-OPD:弱到强泛化的直接在策略蒸馏))
研究背景与问题
现有方法的局限
大模型RL训练rollout成本高昂
直接蒸馏教师最终策略会混入小模型自身缺陷
传统在策略蒸馏OPD要求师生词元分布高度重叠
本文解决的核心挑战
如何低成本地把小模型RL经验迁移给大模型
如何在不要求师生分布重叠的前提下完成迁移
如何避免破坏学生模型自身已有能力
方法与技术贡献
核心创新点
把教师RL前后策略的log-ratio视为隐式奖励ΔT
基于KL正则化RL理论反推奖励信号
无需已知具体奖励函数即可复用RL训练成果
关键模块/组件
序列级目标函数J_Direct-OPD
期望隐式奖励项
KL散度锚定项防止偏离学生初始策略
词元级奖励分解
rt(v)=logπT(v|st)-logπTref(v|st)
Rao-Blackwell化策略梯度
top-k候选词元限制降低方差
自适应KL系数控制
根据批次平均奖励符号动态调整α
公式αm+1=clip(αm(1+ε·sgn(r̄m)),αmin,αmax)
解决不同师生对最佳KL强度不一致问题
训练策略/目标函数
全部在学生自身on-policy rollout上计算奖励
不依赖token-level imitation即可完成迁移
支持多次策略迁移信号的顺序叠加
实验设计与结果
数据集与Baseline
教师对 R1-Distill-1.5B到JustRL-1.5B
教师对 Nemotron-1.5B到QuestA-Nemotron-1.5B
学生模型 Qwen3-1.7B Qwen3-4B R1-Distill-7B
对比基线 直接RL 步数匹配RL
主要指标结果
AIME2024 Qwen3-1.7B从48.3%升至58.3%
AIME2025 Qwen3-1.7B从36.8%升至43.2%
AIME2024 Qwen3-4B从72.5%升至77.6%
AIME2024 R1-Distill-7B从56.7%升至63.1%
跨教师QuestA信号带来+10.7%额外提升
消融实验结论
短序列2048token训练可泛化到更长rollout
固定KL系数非普适需按师生对调参
自适应KL能将奖励拉回零点附近保持采样均衡
理论分析与洞察
为什么有效(机制分析)
log-ratio在KL正则化RL下等价于隐式奖励(差比例常数)
提取的是RL带来的纯改进方向而非教师的全部行为
避免复制小模型能力局限
局限性与边界条件
教师在学生实际状态上无实质改进时方法失效
最佳响应长度与KL强度依赖具体师生组合
依赖教师RL前后checkpoint对的可获得性
影响与展望
潜在应用场景
降低大模型后训练RL算力成本
多信号模块化叠加实现能力补丁式升级
资源受限团队参与前沿RL研究
未来研究方向
探索更通用的自适应超参数机制
扩展到数学推理之外的更多任务领域
研究多教师信号融合与冲突消解策略