← 返回列表

论文综述:APPO 用分支分数把智能体强化学习的功劳分配做到词级

APPO: Agentic Procedural Policy Optimization

原文作者 Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu 机构 中国科学技术大学、阿里巴巴高德(AMAP)、南方科技大学 论文发布 2026-06-10 综述日期 2026-06-15 HF 票数 🔺 59
credit-assignmentreinforcement-learningLLM-agentGRPOtool-usebranching-score
📄 查看原文 →

一、论文是干什么的?

现在很流行让大语言模型(LLM)当智能体(agent):它不只是聊天,而是会多轮调用工具(搜索引擎、计算器、代码执行器),一步步完成复杂任务。训练这种智能体常用强化学习(RL)——让模型多次尝试,做得好给奖励、做得差给惩罚,慢慢学会更好的决策策略。

这里有个核心难题叫功劳分配(credit assignment)。一个任务可能有几十上百步、几千个词,最后只在结尾拿到一个”对/错”的奖励。问题是:这个最终结果到底该归功(或归咎)于中间哪一步决策?这就好比一场足球比赛最后赢了,到底是哪一脚传球起了关键作用,很难说清。

现有的智能体 RL 方法在做功劳分配时用的是”粗粒度规则”:要么以工具调用的边界为界(认为关键决策都发生在调用工具那一刻),要么按固定工作流来切分。本文通过研究”分支位置”发现,真正有影响力的决策点其实散布在整个生成序列里,并不集中在工具调用处——也就是说旧方法把关注点放错了地方。APPO 要做的,就是把功劳分配的粒度从粗糙的”交互单位”下沉到细粒度的”决策点”(具体的 token 位置)。

二、核心方法与创新

分支分数(Branching Score)——决定在哪里分叉探索

强化学习训练时需要”探索”:在某个位置让模型尝试不同的后续走法,看哪条路更好,这叫”分支”。关键是选在哪个位置分叉最划算。APPO 用一个分数把两样东西结合起来打分:

BSt=Z(Entropyt)×Z(FutureValuet)BS_t = Z(\mathrm{Entropy}_t) \times Z(\mathrm{FutureValue}_t)

其中 Z()Z(\cdot) 表示在该序列内做标准化。第一项是 token 熵,衡量模型在这一步有多”拿不准”;第二项是下游影响力(policy-induced likelihood gains),衡量这一步对后续轨迹的概率影响有多大。论文正式版用累计衰减的重要性采样比率 Ω\Omega 表示影响力、用 token 熵 HH 表示不确定性,并对比率做了裁剪。一句话:APPO 专挑那些”既拿不准、又对结果影响大”的位置去探索,而不是机械地在每次工具调用处分叉。

过程级优势缩放(Procedure-level Advantage Scaling)——把功劳更准地分下去

“优势”(advantage)是 RL 里衡量”某个动作比平均水平好多少”的量。APPO 的最终优势写成:

A^n,i=A^base(1+bA^fut)\hat{A}_{n,i} = \hat{A}_{\mathrm{base}} \cdot (1 + b \cdot \hat{A}_{\mathrm{fut}})

其中 A^base\hat{A}_{\mathrm{base}} 是基础优势,A^fut\hat{A}_{\mathrm{fut}} 是”面向未来的项”,用裁剪过的似然比体现这个决策对下游的影响强不强。影响下游越强的决策,拿到的功劳/责任就被放大得越多。

一个工程上的关键设计:分支只用来产生奖励/优势信号,再把信号映射回原始轨迹;只有最初 rollout 的 token 参与优化,分支出来的 token 不计入 actor 损失。这样既能借分支探索拿到信息,又不会让训练被分支干扰。这条技术线是在主流的 GRPO/PPO 算法上做改进。

三、使用了哪些模型和计算资源?

  • 基座模型:Llama3.1-8B-Instruct(80亿参数)与 Qwen2.5-7B-Instruct(70亿参数)为主力训练对象;代码仓库还支持 Qwen2.5 的 7B/8B/14B,GAIA 上有一项用 Qwen3-14B 报告结果。
  • 对比参照模型(非被训练对象):Qwen3-8B/14B、QwQ-32B、DeepSeek-R1-32B/671B、GPT-4o、o1-preview 等。
  • 训练配置:批大小 128;PPO mini-batch 16;推理任务训练 2 个 epoch、搜索任务训练 5 个 epoch;KL 系数 β=0;衰减率 γ=21/τ\gamma = 2^{-1/\tau}(τ=32);分支配置示例 N=4、B=3。
  • GPU 型号/数量/训练时长:论文与公开资料中未明确给出。脚本中出现 cuda0-3cuda4-7 设备分配,暗示是多卡分布式训练,但具体型号、张数与 GPU 小时数均未公开。
  • 代码仓库AMAP-ML/APPO

四、实验结果

论文在 13 个基准上评测,APPO 比强的智能体 RL 基线平均提升约 4 分,同时保持工具调用的高效率和可解释性。13 个基准涵盖三类任务:

任务类型代表基准
数学推理AIME24、AIME25、MATH500、GSM8K、MATH
多跳检索问答WebWalker、HotpotQA、2WikiMultihopQA、Musique、Bamboogle
深度搜索 / 通用助手GAIA、Humanity’s Last Exam、Xbench

核心结论:把”该奖励/惩罚哪一步”从工具调用边界下沉到词级关键决策点,确实带来稳定提升,且不牺牲工具调用效率。

五、潜在应用与已落地应用

  1. 会搜索、会调工具的智能体:自动化研究助手、复杂多跳问答、需要多步检索加推理的任务(直接对应论文的 13 个基准)。
  2. 数学/代码推理智能体:在长链推理中把功劳更精确地分到关键步骤。
  3. 地图 / 出行类智能体规划(推测):作者来自阿里巴巴高德(AMAP),该团队在做智能体规划方向,技术有可能服务于此——但论文未声明已落地于具体产品。

论文定位为方法层面的研究,是”进行中工作”(work in progress),未点名某个已上线的商业产品。

六、网络上的讨论与评价

2026 年 6 月 10 日提交 arXiv,HuggingFace Papers 收录(59 票)。截至综述时,经多平台检索(HuggingFace 讨论区、Twitter/X、Reddit、知乎、机器之心等)未找到针对本篇 APPO 的具体公开讨论或评价,HuggingFace 论文页也无社区评论——可能因为它是新出的进行中工作,关注度尚未积累。

需特别注意避免同名混淆:网络上检索到的多是相关但不同的工作,如 ARPO(Agentic Reinforced Policy Optimization,本文的直接相关工作/基线,APPO 代码声明复用了它的 RL 数据集与评测流程)、AEPO(Agentic Entropy-Balanced Policy Optimization);另有缩写撞名但完全无关的 “APPO=Asynchronous PPO(异步 PPO)“。这些都不能当作对本文的评价。

七、思维导图

mindmap
  root((APPO 智能体过程式策略优化))
    研究背景与问题
      智能体多轮工具调用 用RL训练
      长程信用分配难题 credit assignment
        几千token只有最终对错奖励
        哪一步决策真正起作用
      现有方法的局限
        以工具调用边界为粒度
        按固定workflow切分
        关键决策实际散布在整条序列
    核心方法
      分支分数 Branching Score
        BS_t = Z(Entropy_t) x Z(FutureValue_t)
        第一项 token熵 衡量不确定性
        第二项 下游似然增益 衡量影响力
        正式版用累计衰减重要性采样比率Omega
      过程级优势缩放
        A_hat = A_base x (1 + b x A_fut)
        影响下游越强 功劳放大越多
      工程设计
        分支只产生奖励信号
        信号映射回原始轨迹
        分支token不计入actor损失
      建立在GRPO/PPO技术线上
    实验设计与结果
      基座 Llama3.1-8B-Instruct
      基座 Qwen2.5-7B-Instruct
      13个基准
        数学 AIME24 AIME25 MATH500 GSM8K
        多跳问答 HotpotQA 2Wiki Musique
        深度搜索 GAIA HLE Xbench
      平均比强基线提升约4分
      训练配置 batch128 epoch推理2搜索5 KL=0
    局限与未公开信息
      GPU型号数量未公开
      训练耗时GPU小时未公开
      属work in progress
    影响与展望
      自动化研究助手
      多步检索推理智能体
      地图出行智能体规划 推测