← 返回列表

论文综述:DVAO 动态方差自适应优势优化

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

原文作者 Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang 机构 Alibaba Cloud Computing 论文发布 2026-05-25 综述日期 2026-05-31 HF 票数 🔺 132
reinforcement-learningmulti-rewardGRPOLLM-trainingQwen
📄 查看原文 →

一、论文是干什么的?

想象你正在训练一个 AI 助手,要求它同时做到两件事:回答准确,而且回答简洁。这就是所谓的”多目标优化”——你有多个奖励信号,而不是只有一个。

目前训练大语言模型最流行的强化学习方法叫做 GRPO(组相对策略优化),来自 DeepSeek 团队。GRPO 的思路是:每次提问,让模型生成一组不同的回答,根据好坏计算”优势分数”,再用这个分数更新模型。

问题在于:当你有多个奖励(准确性 + 长度 + 格式)时,如何把它们合并成一个统一的分数用于训练?现有方法要么数值爆炸导致训练不稳定,要么用固定权重无法适应实际情况。DVAO 就是为了解决这个问题。

二、核心方法与创新

用一个教练的比喻来理解:

你同时训练运动员的”体能”和”技术”。与其永远 50:50 地关注两者,不如哪边这周进步空间更大(方差更高),就多关注哪边。方差代表”学习信号的强弱”——分数差异大说明还在快速学习,分数都一样说明这方面已经饱和了。

DVAO 的核心是把固定权重替换为动态权重:

w~k=wkσklwlσl\tilde{w}_k = \frac{w_k \cdot \sigma_k}{\sum_l w_l \cdot \sigma_l}

其中 σk\sigma_k 是当前批次中第 kk 个奖励的标准差。方差越大,说明该目标的学习信号越强,对应权重自动越高。

最终的 DVAO 优势分数为:

ADVAO=kwkσkAklwlσlA_{\text{DVAO}} = \frac{\sum_k w_k \sigma_k A_k}{\sum_l w_l \sigma_l}

这个方案无需额外参数、即插即用,直接嵌入 GRPO 训练框架。论文用严格数学证明了三点:① 旧方法 RC 优势值容易爆炸;② DVAO 优势值有界,训练稳定;③ DVAO 自动捕捉不同目标之间的协同与对抗关系。

与各方法的对比总结:

特性RC(奖励组合)AC(优势组合)DVAO
优势值有界
动态权重
无需手动调超参数
捕捉目标间相关性

三、使用了哪些模型和计算资源?

LLM 模型:

  • 数学推理任务:Qwen3-4B-Base、Qwen3-8B-Base
  • 工具调用任务:Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct

计算资源:

  • GPU:8× NVIDIA H20-3e
  • 训练步数:500 步
  • 训练框架:verl(字节跳动开源 RL 框架)
  • 优化器:AdamW,学习率 1×1061\times10^{-6}
  • 每批次采样回答数:G=16G = 16
  • 最大生成长度:8,192 tokens

训练总时长: 暂无相关信息

四、实验结果

在数学推理任务(AIME-2024/2025 等)上,DVAO 是唯一同时在准确率和长度合规率两个目标上取得最优的方法

方法准确率(8B)长度合规率
GRPO(单目标)52.57%63.47%
RC / AC(传统多目标)~45–46%~98–99%
DVAO(本文)47.49%99.92%

GRPO 虽准确率最高,但长度合规率极低(63.47%);GDPO 合规率极好但准确率崩溃(约 14%);DVAO 是唯一兼顾两者的方法。帕累托前沿分析表明,在任意权重设置下 DVAO 都优于所有基线。

在工具调用任务(BFCL-v4)上,Qwen2.5-7B 下 DVAO 准确率 63.00%、格式合规率 79.21%,分别优于次优方法约 4–3 个百分点。

五、潜在应用与已落地应用

  • 推理模型训练:同时优化准确性 + 回答长度,防止模型过度”思考链”拖长回复
  • AI 智能体工具调用:保证调用正确的同时严格遵守格式规范
  • 多维度对齐:安全性 + 有帮助性 + 简洁性同时优化,替代手动调权重的 RLHF 流程
  • 代码生成:同时优化代码正确性与代码质量

论文来自阿里云团队,该方法有望被整合进通义千问系列的后训练流程,但论文中未明确说明是否已落地。

六、网络上的讨论与评价

论文于 2026 年 5 月 25 日发布,时间较新,目前尚无大量公开的社区讨论。从 HuggingFace Papers 页面可见已被收录,但评论数量有限。

从方法论角度看,DVAO 属于”小而美”的工作:方法简洁、证明严格、实验全面,预计会在 GRPO 改进研究圈引发持续关注。其无需额外参数、无需手动调权重的特点,对工业部署非常友好。

七、思维导图

mindmap
  root((DVAO))
    研究问题
      多目标RL训练的核心矛盾
        多个奖励信号同时优化时梯度互相干扰
        固定权重组合无法适应不同奖励的方差差异
        GRPO单目标准确但忽略格式合规等约束
      现有方法的局限
        RC奖励组合 方差不对齐导致高方差奖励主导
        AC优势组合 理论界更宽松仍有干扰
        GDPO 准确率崩溃仅约14%
    核心方法 动态方差自适应权重
      动态权重公式
        w_tilde_k = w_k乘sigma_k_i 除以 各l的w_l乘sigma_l_i之和
        sigma_k_i为第i个问题下奖励k的组内标准差
        权重随每个问题的奖励分布动态调整
      动态加权优势估计
        A_DVAO = 各k的w_k乘sigma_k_i乘A_k之和 除以 各l的w_l乘sigma_l_i之和
        A_k为第k个奖励的标准GRPO优势
      理论保证
        有界性 A_DVAO的绝对值 ≤ A_sum的绝对值
        隐式跨目标正则化效果
        在任意权重设置下支配帕累托前沿
    实验设置
      任务一 数学推理
        模型 Qwen3-8B-Base
        基准 AIME-2024 AIME-2025 MATH500 OlympiadBench AMC23
        双目标 推理准确率 + 长度不超过4000 tokens合规率
      任务二 工具调用
        模型 Qwen2.5-7B-Instruct
        基准 BFCL-v4
        双目标 调用准确率 + 格式合规率
      训练超参数
        优化器 AdamW 学习率 1e-6
        批次大小 128 prompts 每prompt G=16个响应
        训练步数 500步
        最大生成长度 8192 tokens
        推理温度 0.6 top-p 0.95
    实验结果对比
      数学推理任务
        GRPO 准确率52.57% 长度合规率63.47% 合规率极低
        RC/AC 准确率约45-46% 合规率约98-99% 准确率损失大
        GDPO 准确率仅约14% 方法崩溃
        DVAO 准确率47.49% 合规率99.92% 唯一同时兼顾两者
      工具调用任务
        DVAO 准确率63.00% 格式合规率79.21%
        分别优于次优基线约4和3个百分点
      帕累托前沿分析
        权重扫描 0.1到0.9 DVAO始终在帕累托前沿
        全面优于所有基线的帕累托支配关系
    方法优势
      无需额外参数 无需手动调权重
      计算开销与单目标GRPO相同
      理论上保证不会放大优势估计
      工业部署成本极低