← 返回列表

论文综述:借小模型的RL经验教大模型——直接在策略蒸馏实现弱到强泛化

Weak-to-Strong Generalization via Direct On-Policy Distillation

原文作者 Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou 机构 SIA-Lab (清华大学智能产业研究院AIR与字节跳动Seed联合实验室), 清华大学计算机系, 北京大学 论文发布 2026-07-06 综述日期 2026-07-19 HF 票数 🔺 129
强化学习知识蒸馏大语言模型弱到强泛化推理模型
📄 查看原文 →

一、论文是干什么的?

现在最先进的推理大模型(比如做数学题很强的模型)大多是靠强化学习(RL)训练出来的。但RL训练有个大麻烦:模型越大,每一次「让模型自己生成答案、再根据答案对错打分调整」消耗的算力就越多、成本就越高——这跟人做题快慢无关,纯粹是因为模型参数越多,每算一步要做的计算量就越大。这就好比一家公司想反复做模拟测试再根据结果调整方案:请一位时薪很高的资深专家来做这件事,每天反复试错、反复请人批改反馈,成本很高;换成让一位时薪较低的初级新人来做同样的反复试错和批改,单位时间的成本就低得多。

于是研究者们想了一个取巧的办法:能不能先让一个便宜的小模型去做RL训练,把它从「训练前」到「训练后」学到的经验总结出来,再想办法「灌输」给一个更强的大模型,而不用在大模型上重新跑一遍昂贵的RL?这就是本文要解决的核心问题——如何把小模型RL训练中学到的东西,低成本地迁移给大模型,让大模型也变强,这被称为「弱到强泛化」(weak-to-strong generalization)。

一个自然的想法是直接让大模型模仿小模型RL训练后的最终行为(这叫「蒸馏」,distillation),但作者发现这样做效果有限,因为小模型RL训练后的最终策略里,混杂了「RL学到的有用改进」和「小模型本身能力不足留下的缺陷」,直接模仿等于把缺陷也一起学过来了。本文提出的方法能够把「RL到底改变了什么」这个纯粹的改进信号提取出来,再单独教给大模型。

二、核心方法与创新

论文提出的方法叫 Direct-OPD(Direct On-Policy Distillation,直接在策略蒸馏)。要理解它,可以打一个比方:

假设有个学生(小模型)在参加高考培训班前后各做过一次模拟考。培训前的答题习惯记作”参考策略”,培训后的答题习惯记作”训练后策略”。把这两次答题习惯的差异提取出来(比如”以前遇到这类题倾向选A,现在倾向选B”),这个差异本身就代表了培训班到底教了什么。作者证明,在带KL正则化的RL理论下,训练后策略和参考策略的对数概率之比(log-ratio),恰好就等价于(相差一个正比例常数和与题目相关的偏移量)RL训练时用来打分的那个隐藏奖励函数。换句话说,不需要知道RL当时具体用了什么奖励函数,只要对比”培训前后”的两个模型,就能反推出一份”奖励信号”。

这里说的”策略”(πT\pi_TπTref\pi_{T_{ref}})并不是某一个固定的向量,而是同一个小模型在两个不同训练阶段的权重快照所代表的”给任意上下文打分/选词的整套规则”:πTref\pi_{T_{ref}} 是RL训练开始之前的那份权重(也就是常说的参考模型),πT\pi_T 是用同一套RL算法把权重更新到训练结束之后的那份权重。喂给它某个具体的上下文,它才会通过 Transformer 最后一层算出的 logits 做一次 softmax,退化成一个词表大小的概率向量;而对一整段回答 yylogπT(yx)\log \pi_T(y|x),做法是用”teacher forcing”把 xxyy 整个拼起来走一遍前向传播,把 yy 里每一个词在对应位置上的对数概率加总起来。这个计算方式意味着,不管 yy 是谁写的、用了什么措辞,只要有题目 xx 和这段回答文本,就能分别喂给”训练前”和”训练后”两份权重各算一遍对数概率。

具体来说:

  • πT\pi_T 为小模型RL训练后的策略,πTref\pi_{T_{ref}} 为其RL训练前的参考策略,二者的对数概率差
ΔT(yx)=logπT(yx)logπTref(yx)\Delta_T(y|x) = \log \pi_T(y|x) - \log \pi_{T_{ref}}(y|x)

被当作一个”稠密的隐式奖励”(每个词元都能打分,而不是像常规RL那样只有整句话结束才给一个稀疏奖励)。

  • 大模型(学生)的训练目标变成:在自己生成的答案上,最大化这个隐式奖励的期望,同时用KL散度约束自己不要偏离原本的初始策略太远:
JDirect-OPD(θ)=Ex[Eyπθ[ΔT(yx)]αDKL(πθ(x)πS(x))]J_{\text{Direct-OPD}}(\theta) = \mathbb{E}_x\Big[\mathbb{E}_{y \sim \pi_\theta}[\Delta_T(y|x)] - \alpha \cdot D_{\mathrm{KL}}(\pi_\theta(\cdot|x) \,\|\, \pi_S(\cdot|x))\Big]
  • 这个句子级的目标可以拆解到每个词元(token)上,得到逐词元的即时奖励 rt(v)=logπT(vst)logπTref(vst)r_t(v) = \log \pi_T(v|s_t) - \log \pi_{T_{ref}}(v|s_t),再结合策略梯度方法(Rao-Blackwell化的方法+仅关注概率最高的top-k个候选词)转化为可训练的损失函数。

  • 为了让不同的师生模型组合都能稳定训练,作者还设计了一个自适应KL系数调整机制:根据当前批次的平均隐式奖励是正是负,动态调整KL约束的强弱,防止学生模型”用力过猛”或”学不到东西”。

这个方法最巧妙的地方在于:训练时真正被采样、被优化的分布 yπθy \sim \pi_\theta 始终是学生自己当前的策略——学生用自己的措辞、自己的表达习惯写出一段回答,再把这段学生自己写的话喂给老师”训练前”和”训练后”两份权重各算一遍对数概率、相减,得到这段话该拿多少奖励。老师全程不需要自己生成过这段文字,也不需要学生的用词和老师有任何重合,只是被当作一个”隔空打分器”:如果学生表现出的行为倾向恰好是老师被RL纠正过来的那种(比如先验证条件再套公式),ΔT\Delta_T 就是正的,学生会被强化;如果学生某处的做法正是老师RL训练前后都没变化的部分,ΔT\Delta_T 就接近零,也就不会被当作”改进”传递过去。这样一来,它学的不是老师具体说了什么话、用了哪些词,而是”RL训练把哪些行为变得更好”这个抽象的改进方向,即使学生模型本身的表达习惯和老师完全不同(词汇分布重叠很低),依然能学到进步方向,这就是论文强调的”在完全在策略(on-policy)的状态下进行知识迁移”,避免了传统蒸馏方法要求师生模型输出高度重合才有效的限制。

三、使用了哪些模型和计算资源?

教师模型(小模型,先做RL训练产生”策略变化”信号):

  • R1-Distill-1.5B → 训练后变为 JustRL-1.5B
  • Nemotron-1.5B → 训练后变为 QuestA-Nemotron-1.5B

学生模型(接受迁移信号的更强模型):

  • R1-Distill-7B
  • Qwen3-1.7B
  • Qwen3-4B

计算资源:

  • Direct-OPD 迁移训练:8 张 A100 GPU
  • 小模型RL基线训练(R1-Distill-1.5B):32 张 A100 GPU
  • 大模型直接RL训练(7B模型):32 张 A100 GPU

代码基于经过修改(patched)的 verl 框架实现。

每次训练/实验耗费的时间:

实验资源配置耗时
Direct-OPD 迁移训练(让大模型学习小模型的RL经验)8×A100约4小时
小模型直接RL训练(1.5B模型,1500步)32×A100约160小时
大模型直接RL训练(7B模型)32×A100约320小时

可以看出,Direct-OPD 的迁移训练比在大模型上直接跑一遍RL要快得多(4小时 vs 320小时左右),这正是本文方法的核心卖点:用极低的成本获得接近甚至优于直接RL的收益。

(核实说明:以上4小时/160小时/320小时的数字经查证与原文一致,原文原句为:“a 1500-step RL run on R1-Distill-1.5B takes about 160 hours on 32 A100 GPUs, while RL on R1-Distill-7B takes about 320 hours. After small-model RL, the Direct-OPD transfer stage adds only about 4 hours on 8 A100 GPUs.”,出自论文正文第4.2节附近、Figure 3说明之后的计算量对比段落。)

四、实验结果

主要结果集中在数学推理基准 AIME 2024 / AIME 2025 上(AIME是美国高中生数学竞赛,常用来衡量大模型的数学推理能力):

学生模型评测集迁移前迁移后(+Direct-OPD)提升
Qwen3-1.7BAIME 202448.3%58.3%+10.0%
Qwen3-1.7BAIME 202536.8%43.2%+6.4%
Qwen3-4BAIME 202472.5%77.6%+5.1%
R1-Distill-7BAIME 202456.7%63.1%+6.4%
R1-Distill-7BAIME 202540.5%48.8%+8.3%

其他关键发现:

  • 换一套训练数据得到的迁移信号(QuestA teacher)依然能给 Qwen3-1.7B 在 AIME 2024 上带来 +10.7% 的提升,说明信号具有一定的跨数据泛化性。
  • 在相同RL训练步数下,“小模型RL+迁移”的效果能追平甚至超过”直接在大模型上跑RL”,也就是说花小钱办了大事。
  • 多次叠加有效:连续应用两次独立的策略迁移信号,AIME 2024 分数从48.3%一路提升到58.3%再到63.8%,说明改进信号可以像”打补丁”一样叠加使用。
  • 消融实验发现:用短序列(2048 token)训练出的迁移信号,可以泛化到更长的生成序列上;但固定的KL约束强度不是万能的,不同的师生模型组合需要不同的KL强度,因此才需要前面提到的自适应KL机制。

论文也坦诚指出局限性:如果教师模型在学生模型实际会遇到的状态(states)上并没有实质性的改进,这个方法就可能失效;此外,最佳的训练序列长度和KL约束强度目前仍需要针对不同的师生模型组合分别调试,尚无普适的默认值。

五、潜在应用与已落地应用

潜在应用场景:

  • 大幅降低大模型RL后训练(post-training)成本:企业可以先用小模型做实验性RL调优,再把改进”移植”到线上大模型,无需重复烧算力。
  • 多次叠加不同来源的策略改进信号,实现”模块化”能力提升,类似于给大模型不断打各种能力补丁。
  • 为资源有限的研究团队提供了参与前沿RL研究的低成本路径。

已落地/开源情况:

六、网络上的讨论与评价

该论文在 Hugging Face Papers 页面获得了129个点赞,说明在AI研究社区有较高关注度。搜索发现该论文有在X(前Twitter)上的转发讨论(如 x.com/Memoirs 的相关帖子),以及在 alphaXiv 上有对应的音频/讨论页面(alphaxiv.org)。另外有开发者维护的”awesome-on-policy-distillation”资源列表(github.com/chrisliu298/awesome-on-policy-distillation)收录了这篇论文,说明它已被归入”在策略蒸馏”这一细分技术方向的代表性工作之一。除此之外,暂未搜索到Reddit等论坛的专门讨论帖,也暂无主流科技媒体的深度报道,整体讨论目前主要集中在学术/开发者圈层,尚未看到大规模破圈讨论。

七、思维导图

mindmap
  root((Direct-OPD:弱到强泛化的直接在策略蒸馏))
    研究背景与问题
      现有方法的局限
        大模型RL训练rollout成本高昂
        直接蒸馏教师最终策略会混入小模型自身缺陷
        传统在策略蒸馏OPD要求师生词元分布高度重叠
      本文解决的核心挑战
        如何低成本地把小模型RL经验迁移给大模型
        如何在不要求师生分布重叠的前提下完成迁移
        如何避免破坏学生模型自身已有能力
    方法与技术贡献
      核心创新点
        把教师RL前后策略的log-ratio视为隐式奖励ΔT
        基于KL正则化RL理论反推奖励信号
        无需已知具体奖励函数即可复用RL训练成果
      关键模块/组件
        序列级目标函数J_Direct-OPD
          期望隐式奖励项
          KL散度锚定项防止偏离学生初始策略
        词元级奖励分解
          rt(v)=logπT(v|st)-logπTref(v|st)
          Rao-Blackwell化策略梯度
          top-k候选词元限制降低方差
        自适应KL系数控制
          根据批次平均奖励符号动态调整α
          公式αm+1=clip(αm(1+ε·sgn(r̄m)),αmin,αmax)
          解决不同师生对最佳KL强度不一致问题
      训练策略/目标函数
        全部在学生自身on-policy rollout上计算奖励
        不依赖token-level imitation即可完成迁移
        支持多次策略迁移信号的顺序叠加
    实验设计与结果
      数据集与Baseline
        教师对 R1-Distill-1.5B到JustRL-1.5B
        教师对 Nemotron-1.5B到QuestA-Nemotron-1.5B
        学生模型 Qwen3-1.7B Qwen3-4B R1-Distill-7B
        对比基线 直接RL 步数匹配RL
      主要指标结果
        AIME2024 Qwen3-1.7B从48.3%升至58.3%
        AIME2025 Qwen3-1.7B从36.8%升至43.2%
        AIME2024 Qwen3-4B从72.5%升至77.6%
        AIME2024 R1-Distill-7B从56.7%升至63.1%
        跨教师QuestA信号带来+10.7%额外提升
      消融实验结论
        短序列2048token训练可泛化到更长rollout
        固定KL系数非普适需按师生对调参
        自适应KL能将奖励拉回零点附近保持采样均衡
    理论分析与洞察
      为什么有效(机制分析)
        log-ratio在KL正则化RL下等价于隐式奖励(差比例常数)
        提取的是RL带来的纯改进方向而非教师的全部行为
        避免复制小模型能力局限
      局限性与边界条件
        教师在学生实际状态上无实质改进时方法失效
        最佳响应长度与KL强度依赖具体师生组合
        依赖教师RL前后checkpoint对的可获得性
    影响与展望
      潜在应用场景
        降低大模型后训练RL算力成本
        多信号模块化叠加实现能力补丁式升级
        资源受限团队参与前沿RL研究
      未来研究方向
        探索更通用的自适应超参数机制
        扩展到数学推理之外的更多任务领域
        研究多教师信号融合与冲突消解策略