← 返回列表

论文综述:AREX——面向深度研究的递归自我改进智能体

AREX: Towards a Recursively Self-Improving Agent for Deep Research

原文作者 Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang 机构 Beijing Academy of Artificial Intelligence (BAAI) 论文发布 2026-07-23 综述日期 2026-07-25 HF 票数 🔺 119
deep-researchagentreinforcement-learningself-improvementLLM-agent
📄 查看原文 →

一、论文是干什么的?

现在很多人已经用过”深度研究”(Deep Research)类产品:给它一个复杂问题,它会自己上网搜索、翻阅多个网页、综合信息,最后给出一份有理有据的答案。但这类系统有个通病——遇到需要同时满足好几个条件的问题时(比如”找出2019年到2022年间在某会议上发表过论文、后来加入某家创业公司、并且本科毕业于某所大学的人是谁”),它们往往要么搜索很久还找不到,要么给出一个似是而非、有一两个条件对不上的答案。

这篇论文来自北京智源人工智能研究院(BAAI),提出了一个叫 AREX 的深度研究智能体家族。它的核心洞察是:与其让模型”搜索得更久”,不如让它学会”验证并修正自己已有的答案”,通过一轮轮的自我审查和针对性补充调查,把答案从”大概对”打磨到”确实对”。论文把这种能力称为递归自我改进(Recursively Self-Improving,RSI)智能体。

AREX 推出了两个规格的模型:一个 4B 参数的稠密小模型 AREX-Turbo,一个 122B 总参数/10B 激活参数的混合专家(MoE)大模型 AREX-Base。在 BrowseComp、GAIA、WideSearch、DeepSearchQA、Humanity’s Last Exam(HLE)等多个高难度搜索与推理基准上,AREX 大幅超过同等规模的同类模型,甚至能和参数量大得多的模型掰手腕。

二、核心方法与创新

2.1 “发现难、验证易”的不对称性——用找房子打比方

论文提出的核心概念叫发现-验证不对称性(discovery-verification asymmetry)。用大白话说:

假设你要租一套房子,要求是”月租不超过8000元、离地铁站步行10分钟内、允许养宠物、且是某个特定小区”。同时满足这四个条件的房子,可能全城只有一两套,你得挨个筛选、反复比较,非常费劲——这是”发现”,成本很高。

但如果中介给你推荐了一套房子,你要判断它合不合格,其实很简单:查一下月租(一个条件)、查一下地图距离(第二个条件)、问一下养宠物政策(第三个条件)、确认小区名字(第四个条件)。每个条件单独核对都很轻松,四项核对完就知道这套房子行不行——这是”验证”,成本很低,而且可以拆解成一个个独立的小检查。

论文的关键结论是:既然”验证”比”发现”容易得多,那智能体不应该只会盲目地搜索更长时间,而应该学会”先给出一个候选答案,然后像核对清单一样逐条验证,把没通过的条件当成下一步搜索的具体目标”,这样每一轮搜索都更有针对性,比漫无目的地继续翻页效率高得多。

2.2 内外双循环机制——像”侦探写报告、编辑逐条打回”

AREX 的工作方式被设计成两层循环嵌套:

  • 内循环(inner research loop):好比一名侦探,不断执行”搜索动作”(查资料、访问网页、调用工具),把新证据吸收进自己的笔记,逐步整理出一份”候选答案”,直到觉得这份答案已经能回应问题为止。
  • 外循环(outer self-improvement loop):好比一名严格的编辑,拿到侦探交上来的候选答案后,不是简单地”信不信”,而是给这份答案打一个置信度分数 s(k)s^{(k)}(取值范围 0 到 100,综合考量答案的完整性、内部一致性、证据来源可靠性、信息时效性四个维度)。

编辑接下来会按照下面的规则做决定(τ\tau 是预先设定的置信度门槛,v(k)v^{(k)} 表示当前研究轨迹里是否还含有可用的新线索):

d(k)=Accept,s(k)τRefine,s(k)<τ and v(k)=1Restart,s(k)<τ and v(k)=0d^{(k)}=\begin{aligned} &\text{Accept}, & s^{(k)}\geq\tau\\ &\text{Refine}, & s^{(k)}<\tau \ \text{and}\ v^{(k)}=1\\ &\text{Restart}, & s^{(k)}<\tau \ \text{and}\ v^{(k)}=0 \end{aligned}

也就是说:分数够高(s(k)τs^{(k)}\geq\tau)就接受答案、直接交卷;分数不够但笔记里还有没用完的线索,就精炼——针对没通过验证的具体条件,发起新一轮定向搜索;如果分数不够而且笔记里已经没有可用线索了,就重启——换个思路重新开始搜集证据。这个”编辑打回、侦探带着具体问题再去调查”的过程可以反复多轮,直到答案被真正验证通过,这正是”递归自我改进”名字的由来。

2.3 把越滚越大的交互历史压缩成”精简案卷”

深度研究任务动辄要调用几十次工具、翻阅几十个网页,如果侦探每次决策都要把所有历史记录从头看一遍,不仅费时间,还容易被大量冗余、过时甚至互相矛盾的信息淹没。

AREX 的做法是让模型自己学会一个”上下文更新工具”(context-update tool):每隔一段时间,模型会主动调用这个工具,把当前积累的全部交互历史 ht(k)h_t^{(k)} 压缩成一个精简的”改进状态”(improvement state)zt(k)=fθ(ht(k))z_t^{(k)}=f_\theta(h_t^{(k)})

打比方来说,这就像侦探的助理会定期整理案卷,写一份备忘录:备忘录里保留”已核实的关键事实和它们的证据来源""当前的候选答案""还没解决的疑点""被排除掉的错误候选人""下一步调查计划”;而”重复的观察记录""已经过时的结论""已经作废的计划”则被直接从备忘录里剔除。之后侦探做决策,只需要看这份越来越精炼的备忘录,而不用重新翻遍整个案卷。论文特意强调这个压缩过程完全由模型自身完成,不依赖外部的额外模型来做摘要。

2.4 训练方法:先学会”跑腿”,再学会”推理”,最后用强化学习打磨关键步骤

AREX 的训练分为两大阶段:

第一阶段——多阶段智能体式中期训练(Multi-stage Agentic Mid-training),内部又分为两步:先用大量”高强度网页浏览”的多轮交互轨迹训练模型,建立基本的工具调用和网页导航能力;然后引入专家级的复杂推理数据,强化模型解决难题的能力。论文发现,如果一味强化”推理”数据,模型原本学到的”搜索/浏览”能力会被削弱(即两种能力互相干扰),因此又设计了一个”混合能力巩固阶段”,把复杂学术检索、专家级知识推理与此前的网页浏览轨迹混合、并做选择性重放,让模型的搜索能力和推理能力互不拖累、同时保留。

第二阶段——长程强化学习,使用一种称为”步骤感知的组策略优化”(Step-aware Group Policy Optimization,在标准的组相对策略优化 GRPO 思路上改造而来)的算法。由于深度研究任务链条很长,只有”最终答案对不对”这一个奖励信号太稀疏,模型很难知道究竟是中间哪一步做对了或做错了。为此论文引入”关键步骤”(key steps)概念——比如第一次获得了指向正确答案实体的关键证据、第一次识破错误候选并调转搜索方向、以及关键的上下文更新步骤——并给这些关键步骤额外的奖励加成:

Ai,j=Aiout+λkeyB~i,j,Aiout=RiμRσR+ϵA_{i,j} = A_i^{\mathrm{out}} + \lambda_{\mathrm{key}} \cdot \tilde{B}_{i,j}, \qquad A_i^{\mathrm{out}} = \dfrac{R_i - \mu_R}{\sigma_R + \epsilon}

其中 AioutA_i^{\mathrm{out}} 是轨迹整体奖励 RiR_i 相对于该组内均值 μR\mu_R、标准差 σR\sigma_R 做归一化后的优势值,B~i,j\tilde{B}_{i,j} 是只在成功轨迹里、针对关键步骤额外施加的奖励加成,λkey\lambda_{\mathrm{key}} 是控制加成力度的权重。通俗理解就是:不只奖励”最后答对了”,还额外表扬”在正确的时刻做出了正确的关键判断”,这样模型更容易学到”什么时候该收线索、什么时候该改方向”,而不是在漫长的探索链条中迷失方向。

此外,AREX 的训练数据也经过精心构造:先从真实答案出发提炼出一组约束条件,再把这些约束改写成需要多跳搜索和推理才能验证的间接描述(避免变成一步检索就能查到的简单题),并通过独立的试跑筛掉”太简单能被浅层检索解出”或”根本解不出”的题目,以保证训练任务的难度和有效性。

三、使用了哪些模型和计算资源?

  • 基础模型(backbone):论文明确说明,AREX-Turbo(4B 稠密模型)以 Qwen3.5-4B 为骨干继续训练,AREX-Base(122B 总参数/10B 激活参数的 MoE 模型)以 Qwen3.5-122B-A10B 为骨干继续训练,两者均属于 Qwen 系列开源模型。
  • 训练方法:分为”多阶段智能体式中期训练(mid-training)“和”长程强化学习(RL,采用 Step-aware GRPO)“两大阶段(细节见第二节)。
  • GPU 型号、数量、训练耗费的卡时,以及 mid-training 和 RL 两阶段各自具体耗时:经过对 arXiv 全文(包括实验设置、实现细节等章节)逐字检索确认,论文全文没有出现任何 “GPU""H100""H800""A100""cluster""训练天数/小时数” 等相关表述,也没有给出两阶段各自的训练时长。对应的 GitHub 代码仓库(VectorSpaceLab/arex-model)README 中同样只涉及推理部署方式,未提及训练所用硬件。因此这部分信息论文未明确说明,本综述如实标注,未做任何推测或编造。

四、实验结果

论文在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch(英文版)、Humanity’s Last Exam(HLE,工具增强设置)等多个”深度研究/长程搜索”基准上做了评测。两款 AREX 模型的主要得分如下(数值来自论文正文实验结果表格):

基准测试AREX-Turbo(4B)AREX-Base(122B-A10B MoE)
BrowseComp70.782.5
GAIA81.685.4
xbench-251057.071.0
DeepSearchQA78.589.9
WideSearch-en68.582.0
HLE(工具增强)40.652.4

论文原文的总体结论是:AREX 大幅超越同等规模的对比基线,而且即便对手模型的”激活参数量”远大于 AREX,AREX 依然能保持竞争力——换句话说,AREX-Turbo 这样一个只有 4B 参数的小模型,靠”内外双循环+关键步骤强化学习”这套训练方法,就能打平甚至超过体量大得多的对手。

论文还做了消融实验(以 BrowseComp 为例,完整模型得分 82.5 作为基准):

去掉的组件得分相对完整模型的下降
完整模型(AREX-Base)82.5
去掉”渐进式多轮训练”(改为一步到位训练)77.5-5.0
把”关键步骤监督”换成随机步骤监督74.1-8.4
把”步骤感知强化学习”换成标准 GRPO79.4-3.1

论文对此的解释是:先建立多轮工具调用行为、再引入推理密集型监督这种”分阶段”训练顺序,能降低不同训练目标之间的相互干扰;而”关键步骤”的奖励设计对最终效果的贡献最大——去掉它导致的性能下降最明显,说明”告诉模型什么时候做对了关键判断”比”只告诉它最后答对没答对”重要得多。

五、潜在应用与已落地应用

潜在应用方向:

  • 深度研究类产品:类似 OpenAI Deep Research、Google Deep Research 这类”给一个复杂问题、自动生成有据可查的长篇报告”的助手,AREX 这类能自我验证、自我纠错的智能体特别适合处理多约束条件的复杂调研任务(如尽调报告、竞品分析、学术文献综述)。
  • AI 搜索助手/问答引擎:可以嵌入企业知识库检索、专利/法律条款核查、事实核查(fact-checking)等对准确性要求高的场景,因为它的”验证-修正”机制天然适合处理”答案必须同时满足多个硬性条件”的问题。
  • 长程 Agent 的记忆管理范式:论文里”把交互历史压缩成精简改进状态”的思路,也可以推广到其他需要长时间连续工作的智能体(比如长期编程助手、自动化运维 Agent),用于解决”上下文越用越长、越用越乱”的通病。

已落地情况:

  • 模型权重已经公开发布在 HuggingFace,包括 BAAI/AREX-TurboBAAI/AREX-Base(均收录于 BAAI/arex 合集)。
  • 项目主页与代码仓库已经开源:VectorSpaceLab/arex-model(GitHub),仓库提供了运行 AREX 工作流的 Python SDK 和命令行工具、示例脚本,但截至目前仓库中论文本身与模型权重的下载入口标注为”Coming soon”(即代码框架已放出,完整配套材料仍在陆续补充中),且 README 未标注开源许可证(license)信息。
  • 据论文提交者在 HuggingFace 上留言介绍,团队还上线了一个在线演示应用 arex-research.com,接入了 AREX-Base/Turbo 模型,可直接体验;这一具体绑定关系来自作者自述,网站本身未明确标注后端模型信息。

六、网络上的讨论与评价

通过 HuggingFace Papers 页面可以确认:该论文由作者本人(HuggingFace 用户 zhengliu,对应作者 Zheng Liu)于论文发布次日提交至 HuggingFace Daily Papers,并被评为当日 Paper of the Day 第一名,截至查阅时获得 119 个点赞(upvotes),热度较高。页面下的社区评论区里,论文提交者本人置顶留言说明”模型权重已在 BAAI/arex 合集 公开发布,并已接入线上应用 arex-research.com”;另有 HuggingFace 的 Librarian Bot 自动推荐了几篇相关方向的论文(如 DeepSearch-World、S1-DeepResearch、ECHO 等长程搜索/Agent 记忆管理方向的近期工作),但未见其他实质性的技术讨论内容。

另外,经过对 Reddit、Hacker News、X(Twitter)以及知乎、公众号等中文平台的多轮关键词检索(包括英文原名、arxiv 编号、BAAI 机构名及中文关键词组合),均未搜索到针对本论文的专门讨论帖或深度点评文章。搜索结果多为泛化的”深度研究智能体”或”递归自我改进”领域综述文章,未直接提及 AREX。因此,本节如实说明:除 HuggingFace 论文页面上的点赞数据和提交者留言外,暂未搜索到其他社区(Reddit/Hacker News/X/知乎/公众号等)关于本论文的专门讨论

七、思维导图

mindmap
  root((AREX 递归自我改进深度研究智能体))
    研究背景与问题
      现有深度研究Agent的局限
        单纯延长搜索时间收益递减
        多约束条件答案难以一次发现
        长程交互历史膨胀导致上下文淹没
      核心洞察discovery-verification asymmetry
        发现多约束答案成本高
        验证可分解为逐条约束检查成本低
        引导Agent从盲目搜索转向验证驱动的定向补充
    方法与技术贡献
      内外双循环架构
        Inner Research Loop 内循环研究阶段
          执行搜索动作
          整合检索证据
          构建provisional answer
        Outer Self-Improvement Loop 外循环自我改进
          confidence score s(k)属于0到100
          Accept Refine Restart三态决策规则
          阈值tau与线索标志v(k)联合判定
      Context-Update Tool历史压缩
        改进状态z_t(k)=f_theta(h_t(k))
        保留verified findings来源标识
        保留unresolved constraints与rejected candidates
        剔除冗余观察与过时结论
        完全由模型自身触发不依赖外部摘要模型
      Step-aware Group Policy Optimization
        基于GRPO改造的turn-level策略优化
        层级步骤平衡归一化 hierarchical step-balanced normalization
        key-step识别关键证据获取步与纠错步
        奖励公式A_ij=A_i^out+lambda_key*B_ij
        缓解长程稀疏最终奖励问题
      两阶段Agentic Mid-training
        Stage1渐进式多轮能力训练
          浏览密集型多轮轨迹建立工具调用能力
          引入专家级推理数据强化解题能力
        Stage2混合能力巩固阶段
          缓解推理数据对浏览能力的干扰
          复杂学术检索与知识推理混合
          browse轨迹选择性重放
      验证式合成任务构造
        从答案反推约束集合C(y)
        约束改写为间接多跳描述
        三条件校验避免单跳可解题目
        独立rollout筛除过简单或不可解任务
    实验设计与结果
      模型规格
        AREX-Turbo 4B dense基于Qwen3.5-4B
        AREX-Base 122B-A10B MoE基于Qwen3.5-122B-A10B
      主要评测基准
        BrowseComp Turbo70.7 Base82.5
        GAIA Turbo81.6 Base85.4
        xbench-2510 Turbo57.0 Base71.0
        DeepSearchQA Turbo78.5 Base89.9
        WideSearch-en Turbo68.5 Base82.0
        HLE工具增强 Turbo40.6 Base52.4
      消融实验结论
        去渐进式多轮训练降至77.5
        关键步骤监督换随机步骤降至74.1影响最大
        步骤感知RL换标准GRPO降至79.4
    理论分析与洞察
      为什么有效
        验证驱动的定向补充优于盲目延长搜索
        紧凑改进状态防止长程上下文淹没决策
        关键步骤奖励缓解稀疏奖励下的信用分配难题
      局限与未确定信息
        论文未披露GPU型号数量与训练卡时
        未披露mid-training与RL各阶段具体耗时
        GitHub仓库当前标注模型与论文材料Coming soon
    影响与展望
      潜在应用场景
        深度研究报告类产品与AI搜索助手
        企业知识库核查与法律合规审查
        长程Agent记忆管理范式迁移
      已落地情况
        HuggingFace开源BAAI AREX-Turbo与AREX-Base
        GitHub仓库VectorSpaceLab arex-model
        在线演示应用arex-research.com
      未来研究方向
        扩展至多模态深度研究任务
        进一步压缩改进状态提升长程效率
        探索更细粒度的关键步骤奖励设计