论文综述:双锚定策略蒸馏,让学生模型不再依赖考试作弊
DAPD: Dual-Anchored Policy Distillation
📄 查看原文 →一、论文是干什么的?
想象一个学生在做数学题训练时,老师会在旁边小声提示标准答案的关键步骤,学生在这种提示下把题目做对了,训练成绩看起来很好。但是到了真正考试的时候,没有老师提示了,学生却发现自己其实没有真正学会解题,只是学会了怎么利用提示。这篇论文要解决的就是大语言模型训练中的这样一个问题。
现在流行一种叫做在线自蒸馏(On-Policy Self-Distillation,简称OPSD)的训练方法,它让同一个模型同时扮演老师和学生两个角色。当模型扮演老师时,它能看到标准答案(论文中称为参考补全,reference completion),也就是特权信息;而当它扮演学生时,只能靠自己一步步生成答案,看不到标准答案。问题在于,老师在训练时利用特权信息给学生打分或指导,学生逐渐学会了一种只有在能偷看答案时才管用的行为方式,但这种依赖在真正推理(也就是没有老师在场)时是不存在的。论文把这个现象形象地命名为特权幻觉(privilege illusion):学生表面上看起来学到了知识,实际上学到的是一种它自己在考场上根本用不上的假本领。这篇论文提出了DAPD(双锚定策略蒸馏)方法,专门用来消除这种因为信息不对称带来的虚假进步,让模型学到的东西在没有提示的真实场景下也能用得上。
二、核心方法与创新
要理解DAPD,先要理解论文提出的三种概率分布,可以把它们想象成模型在同一道题目上,处于三种不同的信息条件下给出的答案分布:
- None分布:学生完全不看答案、独立作答时的概率分布,代表真实推理场景。
- Cross分布:学生被允许偷看标准参考答案时的概率分布,代表训练时老师享有的特权视角。
- Self分布:一种介于两者之间的、可训练的分布,它以模型自己正在生成的这句话本身作为条件,而不是以外部的标准答案作为条件。
传统的OPSD方法本质上是让None分布直接去模仿Cross分布(可以理解为论文中的纠缠蒸馏损失,Entangled Distillation,公式为 ,其中 表示停止梯度)。问题就出在这里:Cross分布因为看到了参考答案,会呈现出一些None分布根本模仿不来的行为特征(比如直接引用参考答案里的某个数字),学生越努力去模仿,就越学到那些用不上的花招。
DAPD的创新在于引入了Self分布作为一座桥梁,用两条路径把None和Cross分布分别搭桥连接,这就是Dual-Path Anchoring(双路径锚定,简称DPA):
- 推理锚点损失(Inference Anchor):,让Self分布向None分布看齐,也就是让这座桥梁的一端牢牢锚定在真实推理的能力水平上,不会飘得太高。
- 特权锚点损失(Privileged Anchor):,让Self分布也去吸收一部分Cross分布中有用的信息,把桥梁的另一端连接到老师的智慧上。
通俗地说,就是不再让学生直接模仿那个能偷看答案的老师,而是先造一座中间桥梁:这座桥梁必须先证明自己不依赖标准答案也能达到学生当前的真实水平(推理锚点),然后再让它去吸收标准答案里对提升水平真正有帮助的部分(特权锚点)。这样一来,学生学到的进步就是可持续、可复现的,而不是那种考试时用不上的作弊技巧。
在此基础上,论文又提出了Dual-Source Anchoring(双源锚定,简称DSA)。它注意到指导信息其实有两个来源:一个是可靠但已经偏离模型当前状态的参考答案(reference,好比是老师的标准答案,权威但有点脱离学生实际水平),另一个是学生自己生成、虽然可能有错但确实是学生能力范围以内的自采样结果(rollout,好比是学生自己写的草稿,虽不完美但更贴近自身水平)。DSA把双路径锚定同时用在两个方向上:一次是用参考答案去指导自采样结果(reference-to-rollout),一次是反过来用自采样结果去指导参考答案(rollout-to-reference),再通过一个权重系数 把两种指导方式加权融合起来:
这就好比一个学生既参考老师的标准答案,又参考自己同学(甚至自己之前)写的草稿,两边结合取长补短,而不是完全偏信某一方。论文还发现,权重 需要随着模型规模调整:小模型(1.7B)上参考答案权重更高(0.5),大模型(32B)上则更信任自己的草稿(0.2),因为大模型自身生成的草稿质量已经足够高。
另外一个技术细节是散度的具体实现方式:论文没有用常见的无约束KL散度,而是设计了一种分量截断的前向KL散度(component-clipped forward KL),公式为 ,其中截断阈值 。这相当于在计算每个词的散度贡献时设一个上限,防止个别词的分布差异过大把整个训练信号带偏,实验也证明这种截断版本比不截断或用反向KL效果更好。
三、使用了哪些模型和计算资源?
模型: 论文没有使用GPT-4o、Claude等外部大模型作为额外教师,而是采用了Qwen3系列模型自身进行自蒸馏实验,覆盖五种规模:1.7B、4B、8B、14B、32B参数。所有模型均使用LoRA(低秩适配)方式训练,设置为rank 64、scale 128,即通过轻量级微调而非全参数微调完成实验。论文中没有使用独立的教师模型,同一个模型在训练中同时承担学生和(拥有特权信息的)老师两种角色。
计算资源: 论文中提到使用了8块NVIDIA A100-80GB GPU进行训练。软件栈方面使用了PyTorch 2.8.0、Transformers 4.57.1、DeepSpeed 0.18.2以及vLLM 0.11.0。
训练细节: 有效批次大小(effective batch size)为32,采用线性500步的学习率调度且不使用warmup;学习率为 ,梯度范数裁剪阈值为0.1,使用bfloat16精度训练;训练时上下文长度限制在20000个token以内;采样时使用温度1.1、top-p 0.95、top-k 20,每个问题采样一条rollout,最多生成1024个新token。推理评测阶段针对每道题采样12条带思维链的解答(Avg@12指标),温度为1.0、top-p 0.95,最多允许生成38912个新token。
耗时: 论文中未提及具体的训练总耗时(如每个epoch或每次实验花费多少小时/天),也未提供推理阶段每次生成的具体秒数或延迟数据。
四、实验结果
论文在数学推理、代码能力、指令遵循三大类共六个基准测试上评估了DAPD,测评指标是Avg@12(即对每道题采样12次取平均正确率)。以Qwen3-4B模型为例,结果如下:
| 任务 | 基座模型 | OPSD | DAPD | DAPD相对OPSD提升 |
|---|---|---|---|---|
| AIME24(数学竞赛) | 75.56 | 76.67 | 77.22 | +0.55 |
| AIME25(数学竞赛) | 65.56 | 67.78 | 72.22 | +4.44 |
| HMMT25(数学竞赛) | 42.50 | 43.33 | 46.39 | +3.06 |
| LiveCodeBench v5(代码) | 52.11 | 52.26 | 53.31 | +1.05 |
| BFCL v3(函数调用) | 61.38 | 61.32 | 61.91 | +0.59 |
| IFBench(指令遵循) | 29.67 | 30.67 | 33.00 | +2.33 |
| 六项平均 | 54.46 | 55.34 | 57.34 | +2.00 |
从表中可以看出,DAPD在这六项主实验任务上全面优于OPSD,尤其在数学类任务(AIME25、HMMT25)上提升最明显,整体平均分也更高。
更值得关注的是规模鲁棒性:论文发现OPSD方法在模型规模变大后(比如超过8B参数)改进效果会明显衰减,而DAPD在1.7B到32B的所有规模上都能保持稳定提升,具体是4B规模提升2.69分,32B规模提升2.78分,说明模型越大越不容易通过简单模仿标准答案获得提升,而DAPD这种更谨慎的桥梁式指导方式反而更稳健。
论文还设计了一个衡量特权幻觉严重程度的指标,叫做错误声称(Wrong Claims),用来检测模型是否说出了一些只有看过参考答案才可能知道、但实际上没有真正推理出来的结论。结果显示,在训练250到300步这个阶段,DAPD相比OPSD将这类错误声称减少了73%,具体检测到的错误声称数量(每万次生成中)从OPSD的33次降到了DAPD的9次,这直接证明了DAPD确实缓解了特权幻觉问题,而不只是分数好看。
在跨领域迁移测试中(即训练时只用推理类数据,但评测代码和指令遵循任务),DAPD取得了49.64的跨领域平均分,是所有对比方法中最好的,在LiveCodeBench v5上单项提升达4.82分,说明DAPD学到的能力更具有泛化性,而不是针对某个数据分布过拟合出来的。
消融实验也验证了两个组件都不可或缺:只用纠缠蒸馏损失效果最差,加上推理锚点和特权锚点后逐步提升;同时使用参考和自采样两种指导来源比只用其中一种效果更好;即便完全不用人工整理的参考答案,改用两条独立自采样结果互相指导(dual-rollout)或加入正确性验证器的自采样(verified-rollout),依然能取得正向提升,说明DAPD在缺少高质量参考答案的场景下也具备实用性。
五、潜在应用与已落地应用
潜在应用方向:
- 在缺乏足够高质量人工标注数据、但可以生成参考解答的场景(如数学解题、代码生成、复杂指令遵循)中,用于提升模型自我训练的效率和真实能力,而不只是训练分数好看。
- 可用于降低大模型蒸馏或强化学习训练中的奖励作弊(reward hacking)风险,因为特权幻觉本质上是一种模型钻训练机制空子的表现,该方法思路可能推广到其他涉及特权信息(如工具调用结果、外部知识库检索结果)的自训练场景。
- 论文提出的无需参考答案的双自采样变体(dual-rollout、verified-rollout),意味着该方法未来有可能被用在完全没有标准答案、只能靠自我验证的开放式任务训练中。
已落地应用案例: 论文中未提及已有产品或工业界落地案例,目前仍属于研究阶段的方法验证。论文作者在GitHub上开源了代码仓库(uanu2002/DAPD),供研究社区复现和进一步实验。
六、网络上的讨论与评价
通过网络搜索,找到了少量关于本论文的讨论内容,主要集中在专业AI资讯类网站,尚未发现在Reddit、Hacker News等大众社区形成广泛讨论。
- 德语AI资讯网站mind-verse对该论文做了报道,标题大意为”克服语言模型信息不对称问题的策略蒸馏新框架”。
- 英文AI资讯聚合网站AI Weekly发表了题为DAPD Beats OPSD Distillation Across Qwen3 1.7B to 32B的文章,编辑点评认为该研究的实用启示是:OPSD方法的收益在模型规模超过8B后会明显崩溃,而DAPD能够保持稳定,因此如果研究者在这个规模蒸馏推理模型,值得测试匹配教师和学生信息可用性这个思路。文章同时指出了该研究的局限性:这是单一实验室(作者团队)在单一模型家族(Qwen3,1.7B到32B)上得到的结果,能否迁移到其他模型架构尚不清楚;此外该方法需要针对不同模型规模重新校准超参数,比如参考指导权重 需要从1.7B规模的0.5一路调整到大规模模型的0.2,这在一定程度上增加了实际应用的调参成本。文章还提到有一位AI领域的研究者在Bluesky上转发分享了这篇论文,显示出一定的社交媒体关注度,但整体讨论热度不算高。
- 未搜索到中文技术社区(如知乎、V2EX、掘金等)关于本论文的专门讨论。
总体来看,该论文目前主要在专业AI资讯圈层内传播,属于比较专精的强化学习后训练技术研究,尚未形成大众化的破圈讨论。
七、思维导图
mindmap
root((DAPD双锚定策略蒸馏))
问题定义
特权幻觉privilege illusion
训练时教师可见reference completion
推理时学生无法获取该信息
错误声称Wrong Claims指标
信息不对称information asymmetry
OPSD纠缠蒸馏损失的缺陷
None分布直接模仿Cross分布
三种概率分布构造
None分布p_None
无特权信息的推理时分布
Cross分布p_Cross
条件于参考补全的特权分布
Self分布p_Self
以自身生成内容为条件的可训练桥梁分布
核心损失设计
纠缠蒸馏损失L_ent
None模仿Cross分布D(sg[p_Cross]‖p_None)
推理锚点损失L_infer
Self向None看齐D(sg[p_None]‖p_Self)
特权锚点损失L_priv
Self吸收Cross信息D(sg[p_Cross]‖p_Self)
分量截断前向KL
截断阈值c=0.05
优于无约束KL与反向KL变体
双重锚定机制
Dual-Path Anchoring双路径锚定
无条件路径L_uncond
特权路径直接使用L_priv
Dual-Source Anchoring双源锚定
reference-to-rollout方向
rollout-to-reference方向
权重系数lambda随模型规模调整
无参考变体
dual-rollout双自采样
verified-rollout带验证器自采样
实验验证
Qwen3系列模型
1.7B到32B五种规模
LoRA rank64 scale128微调
基准测试
AIME24 AIME25 HMMT25数学竞赛
LiveCodeBench v5代码任务
BFCL v3函数调用
IFBench指令遵循
关键结果
Qwen3-4B平均提升2.00分
32B规模提升2.78分优于OPSD衰减
Wrong Claims减少73%
跨领域迁移OOD平均49.64最优