← 返回列表

论文综述:Occamy-1.0——面向协同办公的开源帕累托前沿35B智能模型

Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work

原文作者Accio Team机构Accio Team(阿里巴巴集团旗下团队,据公开报道与GitHub仓库信息)论文发布2026-09-04综述日期2026-09-18HF 票数🔺 104
MoE模型智能体协同办公强化学习开源模型
📄 查看原文 →

一、论文是干什么的?

想象一下,你不是让AI帮你写一句诗,而是让它替你完成一整天的工作:打开浏览器订机票、登录后台系统改价格、写一段代码修复bug、再整理成一份报告发给同事——这种需要连续几十步、跨越多个软件和工具、还要记住之前做过什么的长流程任务,业内把它叫作”co-work”(协同办公)。这篇论文介绍的 Occamy-1.0,就是专门为这类长时程、有状态的协同办公任务打造的智能体模型。

它的基座是阿里通义千问系列的 Qwen3.6-35B-A3B(一个总参数35B、但每次只激活约3B参数的混合专家模型),论文团队在这个基座上继续训练,目标不是让模型”更聪明地聊天”,而是让它在真实工作流程里更可靠地把一件事从头做到尾——包括记住状态、从错误中恢复、坚持把任务执行完。更有意思的是,论文特别强调了”性价比”:与其追求榜单第一名,不如做一个买起来划算、用起来也划算的模型。这就好比买手机时,很多人不会选最贵的旗舰机,而是选那款”性能够用、价格却便宜一大截”的型号——论文管这个位置叫作成本-性能帕累托前沿上的”低成本拐点”,Occamy-1.0 正是瞄准了这个拐点去设计的。

二、核心方法与创新

论文的核心创新可以拆成三块:“怎么造训练数据""怎么采集长流程的训练轨迹""怎么分阶段训练模型”。

1. 执行落地的数据构建(execution-grounded data)

传统做法是让人工或者其他模型编一些任务描述,但这类任务往往缺乏真实世界的约束。Occamy-1.0采用了”双路线合成”:

  • 环境优先路线:从真实的工作环境、文档、代码仓库、软件包出发,反过来构造出可以被验证对错的任务(先有环境,再造任务)。
  • 能力优先路线:先抽象出真实工作里需要用到的某项能力(比如”多步筛选并汇总数据”),再找到独立的数据来源,把这项能力实例化到新任务里(先有能力需求,再造环境)。

所有生成出来的任务,都被统一包装成一份”可执行任务契约”,其中包含:公开的用户请求、任务开始时的世界初始状态、可用的工具规范、隐藏起来(不告诉模型)的正确完成方式,以及打分规则。这个”契约”格式保证了不同来源的任务都能被同一套流水线验证和评分。

2. 跨平台可回放的长时程轨迹采集(TiTO机制)

要训练模型完成几十步的长任务,先得把训练数据(也就是模型一步步操作、调用工具、观察结果的完整过程)忠实地记录下来,而且要能在不同的执行环境(论文称为harness,比如终端环境、浏览器环境、工具调用环境等)之间复用。论文为此设计了 TiTO(Token-In-Token-Out)机制:

  • 通过一个与OpenAI接口兼容的代理层,精确捕获每一步用到的token ID、采样时的对数概率(log-probability)、用于强化学习的损失掩码(loss mask)、以及当时使用的模型版本。
  • 在同一个”分段”内部采用”追加式”历史记录,不会对新引入的、非本模型生成的内容重新分词,避免了因为重新tokenize而破坏训练信号的一致性。
  • 当历史记录被重写(比如做了摘要压缩或者剪掉了一部分历史)时,这个动作会被显式记录下来,当前分段随之关闭,并重新开启一个新的TiTO分段。
  • 训练或者评测需要”倒回去重放”某个历史状态时,可以通过环境快照恢复、确定性的fixture重放,或者稳定的会话句柄这三种方式实现,从而让长轨迹可以被精确复现,而不是靠运气。

3. 分阶段后训练(staged post-training)

论文的后训练思路是”两条分支先各自专精、再合并、最后统一精炼”:

  • 两条并行的专精分支:从同一个后训练检查点出发,一条是 Marathon Expert(马拉松专家,擅长长流程任务):先做 SFT,再用一种叫 HDPO 的强化学习方法针对长时程任务继续优化,并引入了”按准确率条件化的效率奖励”——只有当任务做对了,模型走捷径、省步骤才会被额外奖励,避免了模型为了省事而牺牲正确率;另一条是 Sprint Expert(短平快专家,擅长短时程任务):只做 SFT,训练数据覆盖面更广、以短时程协同办公任务为主。两个分支的 SFT 数据去重合并后共约1.5万条轨迹(约4亿token),覆盖通用智能体工作、长时程交互、终端与软件工程、工具调用四大类场景,训练时峰值学习率为 1×10−51\times10^{-5},先做5%线性预热,再余弦衰减到 2×10−72\times10^{-7},训练5个epoch。
  • 模型合并:把 Marathon Expert 和 Sprint Expert 用”均匀模型汤”(uniform model soup,即直接对参数做平均)的方式合并成一个模型。
  • 合并后精炼:在合并后的检查点上,用一种叫 SAO(Single-Rollout Asynchronous Optimization)的强化学习方法,在覆盖面更广的协同办公任务混合集上继续训练;其中借鉴了 CompactionRL 的做法,专门处理”上下文重写”(比如摘要压缩)前后价值估计和策略优化如何保持连续,最终得到 Occamy-1.0。

4. 成本-性能帕累托前沿的计算方法

为了证明”性价比”这件事不是空口白话,论文设计了一套量化方法:先在4个有代表性的协同办公基准上,把每个模型的得分做归一化处理(用该基准上所有参与比较模型的最高分和最低分,把每个模型的分数压缩到0到1之间),再对4个基准的归一化分数取平均、乘以100作为综合性能分;成本这边则用OpenRouter平台上所有同等规模(35B总参数、3B激活参数级别)可比模型的统一最低报价,取4个基准对应场景下平均成本。把综合性能分和平均成本分别画在纵轴和横轴上,就得到了一条”花的钱越多、性能通常越好”的帕累托前沿曲线,而Occamy-1.0恰好落在这条曲线上”性能提升明显、但成本几乎没怎么涨”的转折点,也就是论文所说的”低成本拐点”。需要说明的是,该曲线所用的具体每百万token美元报价数字,原文正文中未直接列出,只在附录里提到这是一份”报价快照”,但我们抓取到的全文内容里没有拿到附录表格的完整数字,这部分具体价格论文中未明确说明。

三、使用了哪些模型和计算资源?

  • 基座模型:Qwen3.6-35B-A3B(阿里通义千问系列的一个已经过后训练的检查点),Occamy-1.0是在此基础上继续训练得到的。
  • 模型结构:一个带有视觉编码器的因果混合专家(MoE)模型,共40层,专家池中共有256个专家,每个token激活8个路由专家,外加1个始终参与计算的共享专家;模型总参数量约35B,但每次推理实际激活的参数量约为3B,这也是它能做到”又强又省”的结构基础。SFT阶段还提到冻结了视觉编码器及其投影层,说明训练重点放在语言与决策能力上。
  • 训练数据规模:约14,998条去重后的轨迹,总计约4.033亿(403.3M)token,平均每条轨迹约2.69万token,分布在通用智能体工作(5,418条)、长时程交互智能体(923条)、终端与软件工程(1,228条)、工具调用grounding(7,429条)四大类。
  • 训练用GPU型号、数量、集群规模:论文附录C的详细配置表中其实披露了具体硬件——SFT阶段使用1个节点、8张 B200 GPU(基于ms-swift 4.5的Megatron后端,张量并行TP=1、上下文并行CP=8、专家并行EP=8);强化学习阶段是完全异步训练,2个”rollout节点”(共16张GPU)负责生成轨迹,另外4个”actor节点”(共32张GPU)负责训练更新,合计约48张GPU参与RL阶段(critic通过优化器offload与actor共享GPU)。第三方媒体报道中提到的”部署该模型至少需要8张GPU并采用张量并行配置”是关于推理部署的说法,与上述训练算力是两回事,仅供参考。
  • 训练与评测耗时:论文中未明确说明。全文没有给出训练花费的具体小时数、天数或周数。
  • 训练成本与推理定价的具体数字:论文中未明确说明。论文提到使用了OpenRouter上的统一报价来计算成本-性能帕累托前沿,并在附录B.2给出”报价快照”表格,但我们能抓取到的全文内容中该表格被截断,未能获取到具体的每百万token美元价格数字。

四、实验结果

论文在多个”协同办公”类基准上评测了Occamy-1.0,简单来说结论是:同等规模(35B总参数、3B激活参数)的模型里它基本都是最强或接近最强的,同时在部分任务上能追平体量大得多的顶尖模型。主要结果如下(表格中数值来自论文正文摘录,供参考):

基准测试Occamy-1.0 表现说明
Claw-Eval(平均分)82.20高于对比模型GPT-5.6 Sol的81.8,低于更大模型Qwen3.8-Max的83.90
Claw-Eval(pass@3)71.40高于GPT-5.6 Sol的68.9
WildClawBench49.16在同等规模模型中处于领先位置
CommerceAgentBench(电商类智能体任务)37.40在同等规模模型中领先
Business Arena(商业模拟,以净资产计)79,868美元在同等规模模型中表现最好
GDPval1128分与同规模模型相比具有竞争力
Terminal-Bench 2.1(终端操作能力)59.00相比基座模型有明显提升
IFEval(指令遵循能力)91.53表现扎实
AutomationBench(Pass@1,自动化流程执行)27.60相比未经过这套训练的基座模型的7.50有大幅提升

用大白话总结:这个模型不是在单一榜单上”刷分王者”,而是在一系列模拟真实长流程工作的测试里,用远低于顶尖大模型的推理成本,做到了”够用甚至好用”的水平。像AutomationBench从7.50分跳到27.60分,说明论文里那套”执行落地数据+分阶段训练”的方法确实针对性地提升了模型完成长流程自动化任务的能力,而不只是泛泛地把模型训练得更聪明。

五、潜在应用与已落地应用

潜在应用方向:

  • 企业内部的”数字员工”:处理跨系统的重复性长流程工作,比如订单处理、报表整理、跨软件的数据搬运。
  • 电商与采购场景的智能体:从CommerceAgentBench的设计和Accio团队的背景看,这类模型很适合用在商品搜索、比价、下单等电商辅助流程中。
  • 软件工程与终端自动化助手:结合Terminal-Bench和AutomationBench上的表现,可以用于自动化脚本执行、代码仓库维护等场景。
  • 低成本的企业级智能体部署:由于模型激活参数量小(3B),配合论文强调的成本优势,适合对推理成本敏感、又需要处理复杂长任务的中小企业。

已落地/已开源的部分:

  • 模型权重已经发布在HuggingFace上,仓库地址为 huggingface.co/Accio-Lab/occamy-1.0,使用Apache 2.0许可证。
  • 配套代码仓库开源在GitHub,地址为 github.com/Accio-Lab/occamy。
  • 论文中提到的训练基础设施Dressage(提供多harness执行、逐token精确的轨迹捕获、沙箱集成、强化学习用的多段转换等能力)也已经开源。
  • 论文摘要中明确提到,团队发布了模型权重以及一部分训练数据,以支持社区在协同办公智能体方向的研究,但具体哪些数据集、以何种形式发布,我们未能从抓取到的内容中确认完整细节。
  • 需要说明的是,“Accio Team”与阿里巴巴集团的关系,是我们从第三方媒体报道和相关仓库信息中了解到的,论文本身以团队集体署名(Accio Team)发表,未在正文中直接列出隶属机构,这一点在综述中如实说明,供读者自行判断。

六、网络上的讨论与评价

我们检索到的公开讨论不算特别丰富,比较有代表性的是科技媒体TechTimes的一篇报道(标题大意为”阿里巴巴发布号称在3B激活参数下达到前沿协同办公得分的开放权重AI智能体”)。这篇报道的主要观点包括:

  • 认为这是”一项确实有意思的技术贡献”(a legitimately interesting technical contribution),但对是否已经达到生产环境部署的成熟度持保留态度。
  • 指出论文中的所有基准分数都是自我报告的结果,截至报道发稿时,还没有独立第三方完成复现验证。
  • 认为目前的基础设施文档仍停留在研究级别,还不是生产就绪的水平。
  • 提到了一些围绕供应链和地缘政治的顾虑,比如相关法律约束和尚未解决的知识产权方面的争议,但报道也承认这类顾虑并非针对这篇论文本身的技术内容。
  • 认可其相对前沿闭源API模型明显的成本优势,尤其是在长链条任务上能显著降低使用成本;同时也指出模型在某些能力(比如长文档理解)上仍有明显短板。
  • 报道给出的基本立场是呼吁”对全貌做诚实的评估,而不是只看基准表格”。

另外,我们在Occamy的官方GitHub仓库中看到一个题为”Verify evals on Papers with Code”的Issue,说明已经有社区成员在主动要求对论文里报告的评测结果进行第三方校验,这从侧面反映出社区对自报分数的谨慎态度。除此之外,我们没有检索到Reddit、Hacker News等平台上关于这篇论文的专门讨论帖,如实说明:目前网络上的独立讨论声量还比较有限,以上内容基本是我们能找到的全部相关评价。

七、思维导图

mindmap
  root((Occamy-1.0:面向协同办公的帕累托前沿35B智能体))
    研究背景与挑战
      通用聊天模型难支撑长时程有状态任务
      缺乏跨harness统一的可回放轨迹格式
      核心挑战:35B总参数3B激活规模下逼近前沿并优化成本-性能
    execution-grounded数据与轨迹采集
      双路线任务合成
        Environment-first环境优先合成
        Capability-first能力优先合成
      统一可执行任务契约
        公开请求与初始世界状态
        工具规范与隐藏完成方式及评分
      TiTO机制 Token-In-Token-Out
        OpenAI兼容代理捕获token ID/log-prob/loss mask
        append-only分段,历史重写触发新分段
        三种回放:环境快照/确定性fixture/稳定会话句柄
    分阶段post-training训练配方
      Stage1 SFT冷启动
        约15K轨迹403.3M tokens,四类数据配比
        lr 1e-5,5%预热,cosine降至2e-7,5 epoch
      Stage2 专精分化
        Marathon Expert:SFT+HDPO,准确率条件化效率奖励
        Sprint Expert:仅SFT,覆盖更广的短时程任务
      Stage3 uniform model soup模型合并
      Stage4 合并后SAO加CompactionRL精炼
    实验结果与基准
      Co-work基准
        Claw-Eval均值82.20/pass3 71.40,WildClawBench 49.16
        CommerceAgentBench 37.40,Business Arena 79868美元,GDPval 1128
      支撑能力基准
        Terminal-Bench 2.1 得分59.00,IFEval 得分91.53
        AutomationBench Pass1 27.60对比基座7.50
      对比对象
        起始检查点Qwen3.6-35B-A3B基座
        GPT-5.6 Sol与Qwen3.8-Max
    成本-性能帕累托前沿
      归一化公式:(s减min_j)除以(max_j减min_j)
      聚合指标:四基准归一化均值乘100,含Claw-Eval WildClawBench AutomationBench GDPval
      成本:OpenRouter同规模模型最低报价均值
      低成本拐点low-cost knee
    开源生态与影响
      开源发布:HuggingFace权重、GitHub代码、Dressage训练基础设施
      潜在应用:企业数字员工、电商采购、终端与软件工程助手
      局限与争议:自报基准缺乏第三方复现、长文档理解能力短板