论文综述:AREX——面向深度研究的递归自我改进智能体
AREX: Towards a Recursively Self-Improving Agent for Deep Research
📄 查看原文 →一、论文是干什么的?
现在很多人已经用过”深度研究”(Deep Research)类产品:给它一个复杂问题,它会自己上网搜索、翻阅多个网页、综合信息,最后给出一份有理有据的答案。但这类系统有个通病——遇到需要同时满足好几个条件的问题时(比如”找出2019年到2022年间在某会议上发表过论文、后来加入某家创业公司、并且本科毕业于某所大学的人是谁”),它们往往要么搜索很久还找不到,要么给出一个似是而非、有一两个条件对不上的答案。
这篇论文来自北京智源人工智能研究院(BAAI),提出了一个叫 AREX 的深度研究智能体家族。它的核心洞察是:与其让模型”搜索得更久”,不如让它学会”验证并修正自己已有的答案”,通过一轮轮的自我审查和针对性补充调查,把答案从”大概对”打磨到”确实对”。论文把这种能力称为递归自我改进(Recursively Self-Improving,RSI)智能体。
AREX 推出了两个规格的模型:一个 4B 参数的稠密小模型 AREX-Turbo,一个 122B 总参数/10B 激活参数的混合专家(MoE)大模型 AREX-Base。在 BrowseComp、GAIA、WideSearch、DeepSearchQA、Humanity’s Last Exam(HLE)等多个高难度搜索与推理基准上,AREX 大幅超过同等规模的同类模型,甚至能和参数量大得多的模型掰手腕。
二、核心方法与创新
2.1 “发现难、验证易”的不对称性——用找房子打比方
论文提出的核心概念叫发现-验证不对称性(discovery-verification asymmetry)。用大白话说:
假设你要租一套房子,要求是”月租不超过8000元、离地铁站步行10分钟内、允许养宠物、且是某个特定小区”。同时满足这四个条件的房子,可能全城只有一两套,你得挨个筛选、反复比较,非常费劲——这是”发现”,成本很高。
但如果中介给你推荐了一套房子,你要判断它合不合格,其实很简单:查一下月租(一个条件)、查一下地图距离(第二个条件)、问一下养宠物政策(第三个条件)、确认小区名字(第四个条件)。每个条件单独核对都很轻松,四项核对完就知道这套房子行不行——这是”验证”,成本很低,而且可以拆解成一个个独立的小检查。
论文的关键结论是:既然”验证”比”发现”容易得多,那智能体不应该只会盲目地搜索更长时间,而应该学会”先给出一个候选答案,然后像核对清单一样逐条验证,把没通过的条件当成下一步搜索的具体目标”,这样每一轮搜索都更有针对性,比漫无目的地继续翻页效率高得多。
2.2 内外双循环机制——像”侦探写报告、编辑逐条打回”
AREX 的工作方式被设计成两层循环嵌套:
- 内循环(inner research loop):好比一名侦探,不断执行”搜索动作”(查资料、访问网页、调用工具),把新证据吸收进自己的笔记,逐步整理出一份”候选答案”,直到觉得这份答案已经能回应问题为止。
- 外循环(outer self-improvement loop):好比一名严格的编辑,拿到侦探交上来的候选答案后,不是简单地”信不信”,而是给这份答案打一个置信度分数 (取值范围 0 到 100,综合考量答案的完整性、内部一致性、证据来源可靠性、信息时效性四个维度)。
编辑接下来会按照下面的规则做决定( 是预先设定的置信度门槛, 表示当前研究轨迹里是否还含有可用的新线索):
也就是说:分数够高()就接受答案、直接交卷;分数不够但笔记里还有没用完的线索,就精炼——针对没通过验证的具体条件,发起新一轮定向搜索;如果分数不够而且笔记里已经没有可用线索了,就重启——换个思路重新开始搜集证据。这个”编辑打回、侦探带着具体问题再去调查”的过程可以反复多轮,直到答案被真正验证通过,这正是”递归自我改进”名字的由来。
2.3 把越滚越大的交互历史压缩成”精简案卷”
深度研究任务动辄要调用几十次工具、翻阅几十个网页,如果侦探每次决策都要把所有历史记录从头看一遍,不仅费时间,还容易被大量冗余、过时甚至互相矛盾的信息淹没。
AREX 的做法是让模型自己学会一个”上下文更新工具”(context-update tool):每隔一段时间,模型会主动调用这个工具,把当前积累的全部交互历史 压缩成一个精简的”改进状态”(improvement state)。
打比方来说,这就像侦探的助理会定期整理案卷,写一份备忘录:备忘录里保留”已核实的关键事实和它们的证据来源""当前的候选答案""还没解决的疑点""被排除掉的错误候选人""下一步调查计划”;而”重复的观察记录""已经过时的结论""已经作废的计划”则被直接从备忘录里剔除。之后侦探做决策,只需要看这份越来越精炼的备忘录,而不用重新翻遍整个案卷。论文特意强调这个压缩过程完全由模型自身完成,不依赖外部的额外模型来做摘要。
2.4 训练方法:先学会”跑腿”,再学会”推理”,最后用强化学习打磨关键步骤
AREX 的训练分为两大阶段:
第一阶段——多阶段智能体式中期训练(Multi-stage Agentic Mid-training),内部又分为两步:先用大量”高强度网页浏览”的多轮交互轨迹训练模型,建立基本的工具调用和网页导航能力;然后引入专家级的复杂推理数据,强化模型解决难题的能力。论文发现,如果一味强化”推理”数据,模型原本学到的”搜索/浏览”能力会被削弱(即两种能力互相干扰),因此又设计了一个”混合能力巩固阶段”,把复杂学术检索、专家级知识推理与此前的网页浏览轨迹混合、并做选择性重放,让模型的搜索能力和推理能力互不拖累、同时保留。
第二阶段——长程强化学习,使用一种称为”步骤感知的组策略优化”(Step-aware Group Policy Optimization,在标准的组相对策略优化 GRPO 思路上改造而来)的算法。由于深度研究任务链条很长,只有”最终答案对不对”这一个奖励信号太稀疏,模型很难知道究竟是中间哪一步做对了或做错了。为此论文引入”关键步骤”(key steps)概念——比如第一次获得了指向正确答案实体的关键证据、第一次识破错误候选并调转搜索方向、以及关键的上下文更新步骤——并给这些关键步骤额外的奖励加成:
其中 是轨迹整体奖励 相对于该组内均值 、标准差 做归一化后的优势值, 是只在成功轨迹里、针对关键步骤额外施加的奖励加成, 是控制加成力度的权重。通俗理解就是:不只奖励”最后答对了”,还额外表扬”在正确的时刻做出了正确的关键判断”,这样模型更容易学到”什么时候该收线索、什么时候该改方向”,而不是在漫长的探索链条中迷失方向。
此外,AREX 的训练数据也经过精心构造:先从真实答案出发提炼出一组约束条件,再把这些约束改写成需要多跳搜索和推理才能验证的间接描述(避免变成一步检索就能查到的简单题),并通过独立的试跑筛掉”太简单能被浅层检索解出”或”根本解不出”的题目,以保证训练任务的难度和有效性。
三、使用了哪些模型和计算资源?
- 基础模型(backbone):论文明确说明,AREX-Turbo(4B 稠密模型)以 Qwen3.5-4B 为骨干继续训练,AREX-Base(122B 总参数/10B 激活参数的 MoE 模型)以 Qwen3.5-122B-A10B 为骨干继续训练,两者均属于 Qwen 系列开源模型。
- 训练方法:分为”多阶段智能体式中期训练(mid-training)“和”长程强化学习(RL,采用 Step-aware GRPO)“两大阶段(细节见第二节)。
- GPU 型号、数量、训练耗费的卡时,以及 mid-training 和 RL 两阶段各自具体耗时:经过对 arXiv 全文(包括实验设置、实现细节等章节)逐字检索确认,论文全文没有出现任何 “GPU""H100""H800""A100""cluster""训练天数/小时数” 等相关表述,也没有给出两阶段各自的训练时长。对应的 GitHub 代码仓库(VectorSpaceLab/arex-model)README 中同样只涉及推理部署方式,未提及训练所用硬件。因此这部分信息论文未明确说明,本综述如实标注,未做任何推测或编造。
四、实验结果
论文在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch(英文版)、Humanity’s Last Exam(HLE,工具增强设置)等多个”深度研究/长程搜索”基准上做了评测。两款 AREX 模型的主要得分如下(数值来自论文正文实验结果表格):
| 基准测试 | AREX-Turbo(4B) | AREX-Base(122B-A10B MoE) |
|---|---|---|
| BrowseComp | 70.7 | 82.5 |
| GAIA | 81.6 | 85.4 |
| xbench-2510 | 57.0 | 71.0 |
| DeepSearchQA | 78.5 | 89.9 |
| WideSearch-en | 68.5 | 82.0 |
| HLE(工具增强) | 40.6 | 52.4 |
论文原文的总体结论是:AREX 大幅超越同等规模的对比基线,而且即便对手模型的”激活参数量”远大于 AREX,AREX 依然能保持竞争力——换句话说,AREX-Turbo 这样一个只有 4B 参数的小模型,靠”内外双循环+关键步骤强化学习”这套训练方法,就能打平甚至超过体量大得多的对手。
论文还做了消融实验(以 BrowseComp 为例,完整模型得分 82.5 作为基准):
| 去掉的组件 | 得分 | 相对完整模型的下降 |
|---|---|---|
| 完整模型(AREX-Base) | 82.5 | — |
| 去掉”渐进式多轮训练”(改为一步到位训练) | 77.5 | -5.0 |
| 把”关键步骤监督”换成随机步骤监督 | 74.1 | -8.4 |
| 把”步骤感知强化学习”换成标准 GRPO | 79.4 | -3.1 |
论文对此的解释是:先建立多轮工具调用行为、再引入推理密集型监督这种”分阶段”训练顺序,能降低不同训练目标之间的相互干扰;而”关键步骤”的奖励设计对最终效果的贡献最大——去掉它导致的性能下降最明显,说明”告诉模型什么时候做对了关键判断”比”只告诉它最后答对没答对”重要得多。
五、潜在应用与已落地应用
潜在应用方向:
- 深度研究类产品:类似 OpenAI Deep Research、Google Deep Research 这类”给一个复杂问题、自动生成有据可查的长篇报告”的助手,AREX 这类能自我验证、自我纠错的智能体特别适合处理多约束条件的复杂调研任务(如尽调报告、竞品分析、学术文献综述)。
- AI 搜索助手/问答引擎:可以嵌入企业知识库检索、专利/法律条款核查、事实核查(fact-checking)等对准确性要求高的场景,因为它的”验证-修正”机制天然适合处理”答案必须同时满足多个硬性条件”的问题。
- 长程 Agent 的记忆管理范式:论文里”把交互历史压缩成精简改进状态”的思路,也可以推广到其他需要长时间连续工作的智能体(比如长期编程助手、自动化运维 Agent),用于解决”上下文越用越长、越用越乱”的通病。
已落地情况:
- 模型权重已经公开发布在 HuggingFace,包括 BAAI/AREX-Turbo 和 BAAI/AREX-Base(均收录于 BAAI/arex 合集)。
- 项目主页与代码仓库已经开源:VectorSpaceLab/arex-model(GitHub),仓库提供了运行 AREX 工作流的 Python SDK 和命令行工具、示例脚本,但截至目前仓库中论文本身与模型权重的下载入口标注为”Coming soon”(即代码框架已放出,完整配套材料仍在陆续补充中),且 README 未标注开源许可证(license)信息。
- 据论文提交者在 HuggingFace 上留言介绍,团队还上线了一个在线演示应用 arex-research.com,接入了 AREX-Base/Turbo 模型,可直接体验;这一具体绑定关系来自作者自述,网站本身未明确标注后端模型信息。
六、网络上的讨论与评价
通过 HuggingFace Papers 页面可以确认:该论文由作者本人(HuggingFace 用户 zhengliu,对应作者 Zheng Liu)于论文发布次日提交至 HuggingFace Daily Papers,并被评为当日 Paper of the Day 第一名,截至查阅时获得 119 个点赞(upvotes),热度较高。页面下的社区评论区里,论文提交者本人置顶留言说明”模型权重已在 BAAI/arex 合集 公开发布,并已接入线上应用 arex-research.com”;另有 HuggingFace 的 Librarian Bot 自动推荐了几篇相关方向的论文(如 DeepSearch-World、S1-DeepResearch、ECHO 等长程搜索/Agent 记忆管理方向的近期工作),但未见其他实质性的技术讨论内容。
另外,经过对 Reddit、Hacker News、X(Twitter)以及知乎、公众号等中文平台的多轮关键词检索(包括英文原名、arxiv 编号、BAAI 机构名及中文关键词组合),均未搜索到针对本论文的专门讨论帖或深度点评文章。搜索结果多为泛化的”深度研究智能体”或”递归自我改进”领域综述文章,未直接提及 AREX。因此,本节如实说明:除 HuggingFace 论文页面上的点赞数据和提交者留言外,暂未搜索到其他社区(Reddit/Hacker News/X/知乎/公众号等)关于本论文的专门讨论。
七、思维导图
mindmap
root((AREX 递归自我改进深度研究智能体))
研究背景与问题
现有深度研究Agent的局限
单纯延长搜索时间收益递减
多约束条件答案难以一次发现
长程交互历史膨胀导致上下文淹没
核心洞察discovery-verification asymmetry
发现多约束答案成本高
验证可分解为逐条约束检查成本低
引导Agent从盲目搜索转向验证驱动的定向补充
方法与技术贡献
内外双循环架构
Inner Research Loop 内循环研究阶段
执行搜索动作
整合检索证据
构建provisional answer
Outer Self-Improvement Loop 外循环自我改进
confidence score s(k)属于0到100
Accept Refine Restart三态决策规则
阈值tau与线索标志v(k)联合判定
Context-Update Tool历史压缩
改进状态z_t(k)=f_theta(h_t(k))
保留verified findings来源标识
保留unresolved constraints与rejected candidates
剔除冗余观察与过时结论
完全由模型自身触发不依赖外部摘要模型
Step-aware Group Policy Optimization
基于GRPO改造的turn-level策略优化
层级步骤平衡归一化 hierarchical step-balanced normalization
key-step识别关键证据获取步与纠错步
奖励公式A_ij=A_i^out+lambda_key*B_ij
缓解长程稀疏最终奖励问题
两阶段Agentic Mid-training
Stage1渐进式多轮能力训练
浏览密集型多轮轨迹建立工具调用能力
引入专家级推理数据强化解题能力
Stage2混合能力巩固阶段
缓解推理数据对浏览能力的干扰
复杂学术检索与知识推理混合
browse轨迹选择性重放
验证式合成任务构造
从答案反推约束集合C(y)
约束改写为间接多跳描述
三条件校验避免单跳可解题目
独立rollout筛除过简单或不可解任务
实验设计与结果
模型规格
AREX-Turbo 4B dense基于Qwen3.5-4B
AREX-Base 122B-A10B MoE基于Qwen3.5-122B-A10B
主要评测基准
BrowseComp Turbo70.7 Base82.5
GAIA Turbo81.6 Base85.4
xbench-2510 Turbo57.0 Base71.0
DeepSearchQA Turbo78.5 Base89.9
WideSearch-en Turbo68.5 Base82.0
HLE工具增强 Turbo40.6 Base52.4
消融实验结论
去渐进式多轮训练降至77.5
关键步骤监督换随机步骤降至74.1影响最大
步骤感知RL换标准GRPO降至79.4
理论分析与洞察
为什么有效
验证驱动的定向补充优于盲目延长搜索
紧凑改进状态防止长程上下文淹没决策
关键步骤奖励缓解稀疏奖励下的信用分配难题
局限与未确定信息
论文未披露GPU型号数量与训练卡时
未披露mid-training与RL各阶段具体耗时
GitHub仓库当前标注模型与论文材料Coming soon
影响与展望
潜在应用场景
深度研究报告类产品与AI搜索助手
企业知识库核查与法律合规审查
长程Agent记忆管理范式迁移
已落地情况
HuggingFace开源BAAI AREX-Turbo与AREX-Base
GitHub仓库VectorSpaceLab arex-model
在线演示应用arex-research.com
未来研究方向
扩展至多模态深度研究任务
进一步压缩改进状态提升长程效率
探索更细粒度的关键步骤奖励设计