论文综述:DVAO 动态方差自适应优势优化
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
📄 查看原文 →一、论文是干什么的?
想象你正在训练一个 AI 助手,要求它同时做到两件事:回答准确,而且回答简洁。这就是所谓的”多目标优化”——你有多个奖励信号,而不是只有一个。
目前训练大语言模型最流行的强化学习方法叫做 GRPO(组相对策略优化),来自 DeepSeek 团队。GRPO 的思路是:每次提问,让模型生成一组不同的回答,根据好坏计算”优势分数”,再用这个分数更新模型。
问题在于:当你有多个奖励(准确性 + 长度 + 格式)时,如何把它们合并成一个统一的分数用于训练?现有方法要么数值爆炸导致训练不稳定,要么用固定权重无法适应实际情况。DVAO 就是为了解决这个问题。
二、核心方法与创新
用一个教练的比喻来理解:
你同时训练运动员的”体能”和”技术”。与其永远 50:50 地关注两者,不如哪边这周进步空间更大(方差更高),就多关注哪边。方差代表”学习信号的强弱”——分数差异大说明还在快速学习,分数都一样说明这方面已经饱和了。
DVAO 的核心是把固定权重替换为动态权重:
其中 是当前批次中第 个奖励的标准差。方差越大,说明该目标的学习信号越强,对应权重自动越高。
最终的 DVAO 优势分数为:
这个方案无需额外参数、即插即用,直接嵌入 GRPO 训练框架。论文用严格数学证明了三点:① 旧方法 RC 优势值容易爆炸;② DVAO 优势值有界,训练稳定;③ DVAO 自动捕捉不同目标之间的协同与对抗关系。
与各方法的对比总结:
| 特性 | RC(奖励组合) | AC(优势组合) | DVAO |
|---|---|---|---|
| 优势值有界 | 否 | 是 | 是 |
| 动态权重 | 否 | 否 | 是 |
| 无需手动调超参数 | 否 | 否 | 是 |
| 捕捉目标间相关性 | 否 | 否 | 是 |
三、使用了哪些模型和计算资源?
LLM 模型:
- 数学推理任务:Qwen3-4B-Base、Qwen3-8B-Base
- 工具调用任务:Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct
计算资源:
- GPU:8× NVIDIA H20-3e
- 训练步数:500 步
- 训练框架:verl(字节跳动开源 RL 框架)
- 优化器:AdamW,学习率
- 每批次采样回答数:
- 最大生成长度:8,192 tokens
训练总时长: 暂无相关信息
四、实验结果
在数学推理任务(AIME-2024/2025 等)上,DVAO 是唯一同时在准确率和长度合规率两个目标上取得最优的方法:
| 方法 | 准确率(8B) | 长度合规率 |
|---|---|---|
| GRPO(单目标) | 52.57% | 63.47% |
| RC / AC(传统多目标) | ~45–46% | ~98–99% |
| DVAO(本文) | 47.49% | 99.92% |
GRPO 虽准确率最高,但长度合规率极低(63.47%);GDPO 合规率极好但准确率崩溃(约 14%);DVAO 是唯一兼顾两者的方法。帕累托前沿分析表明,在任意权重设置下 DVAO 都优于所有基线。
在工具调用任务(BFCL-v4)上,Qwen2.5-7B 下 DVAO 准确率 63.00%、格式合规率 79.21%,分别优于次优方法约 4–3 个百分点。
五、潜在应用与已落地应用
- 推理模型训练:同时优化准确性 + 回答长度,防止模型过度”思考链”拖长回复
- AI 智能体工具调用:保证调用正确的同时严格遵守格式规范
- 多维度对齐:安全性 + 有帮助性 + 简洁性同时优化,替代手动调权重的 RLHF 流程
- 代码生成:同时优化代码正确性与代码质量
论文来自阿里云团队,该方法有望被整合进通义千问系列的后训练流程,但论文中未明确说明是否已落地。
六、网络上的讨论与评价
论文于 2026 年 5 月 25 日发布,时间较新,目前尚无大量公开的社区讨论。从 HuggingFace Papers 页面可见已被收录,但评论数量有限。
从方法论角度看,DVAO 属于”小而美”的工作:方法简洁、证明严格、实验全面,预计会在 GRPO 改进研究圈引发持续关注。其无需额外参数、无需手动调权重的特点,对工业部署非常友好。
七、思维导图
mindmap
root((DVAO))
研究问题
多目标RL训练的核心矛盾
多个奖励信号同时优化时梯度互相干扰
固定权重组合无法适应不同奖励的方差差异
GRPO单目标准确但忽略格式合规等约束
现有方法的局限
RC奖励组合 方差不对齐导致高方差奖励主导
AC优势组合 理论界更宽松仍有干扰
GDPO 准确率崩溃仅约14%
核心方法 动态方差自适应权重
动态权重公式
w_tilde_k = w_k乘sigma_k_i 除以 各l的w_l乘sigma_l_i之和
sigma_k_i为第i个问题下奖励k的组内标准差
权重随每个问题的奖励分布动态调整
动态加权优势估计
A_DVAO = 各k的w_k乘sigma_k_i乘A_k之和 除以 各l的w_l乘sigma_l_i之和
A_k为第k个奖励的标准GRPO优势
理论保证
有界性 A_DVAO的绝对值 ≤ A_sum的绝对值
隐式跨目标正则化效果
在任意权重设置下支配帕累托前沿
实验设置
任务一 数学推理
模型 Qwen3-8B-Base
基准 AIME-2024 AIME-2025 MATH500 OlympiadBench AMC23
双目标 推理准确率 + 长度不超过4000 tokens合规率
任务二 工具调用
模型 Qwen2.5-7B-Instruct
基准 BFCL-v4
双目标 调用准确率 + 格式合规率
训练超参数
优化器 AdamW 学习率 1e-6
批次大小 128 prompts 每prompt G=16个响应
训练步数 500步
最大生成长度 8192 tokens
推理温度 0.6 top-p 0.95
实验结果对比
数学推理任务
GRPO 准确率52.57% 长度合规率63.47% 合规率极低
RC/AC 准确率约45-46% 合规率约98-99% 准确率损失大
GDPO 准确率仅约14% 方法崩溃
DVAO 准确率47.49% 合规率99.92% 唯一同时兼顾两者
工具调用任务
DVAO 准确率63.00% 格式合规率79.21%
分别优于次优基线约4和3个百分点
帕累托前沿分析
权重扫描 0.1到0.9 DVAO始终在帕累托前沿
全面优于所有基线的帕累托支配关系
方法优势
无需额外参数 无需手动调权重
计算开销与单目标GRPO相同
理论上保证不会放大优势估计
工业部署成本极低