← 返回列表

论文综述:PEFT规模化 — 迈向万亿参数的百万个人模型

On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters

原文作者 Mind Lab Team (Macaron AI) 机构 Mind Lab / Macaron AI 论文发布 2026-06-01 综述日期 2026-06-02 HF 票数 🔺 52
peftlorapersonalizationtrillion-parametersscalingrl-training
📄 查看原文 →

一、论文是干什么的?

传统认知把PEFT(参数高效微调)视为”穷人版全量微调”——算力不够时的退而求其次。这篇论文从根本上颠覆了这个认知。

核心洞察: 未来每个人都可能需要一个有个人记忆和习惯的AI助手。如果每人一个完整的万亿参数模型,存储和算力成本是天文数字。解法是:共享的大脑(基座模型) 住在服务器上供所有人使用,每人专属的”个性小芯片”(LoRA适配器) 极其轻薄,只存储用户的个人偏好和技能。

图书馆类比: 百科全书(基座模型)放在公共区域,每位读者只带一张记个人笔记的小卡片(LoRA适配器)。问题变成:如何管理同时服务100万个读者各自的小卡片?

二、核心方法与创新

什么是LoRA?

LoRA(低秩适配)用两个极小矩阵 A×B 来近似表示对原始参数的修改量(ΔW = A×B)。在最极端压缩(rank-1)设置下,适配器大小可以小于基座模型的1%

全量微调 = 把整个操作系统重装;LoRA = 只安装几个小插件,代价极低但效果接近。

三个缩放维度

Scale Up(向上缩放)——基座越强,个性化越省力

基座模型越强大,LoRA适配器就越小效果越好。论文首次在超过1万亿参数的模型(Kimi K2,MoE架构)上验证了LoRA强化学习完整流程,支持MLA、DSA等新型注意力机制。

Scale Down(向下缩放)——适配器能有多小?

  • 4B密集模型:只传输适配器比传完整检查点快 18.3倍
  • 30B MoE模型:传输速度快 2.85倍
  • Rank-1设置下适配器可小于基座模型的 1%

Scale Out(向外缩放)——管理百万个适配器

  • 系统可管理 10⁶(百万)规模的适配器目录
  • 单引擎测试超过 10万次适配器切换
  • 集群规模下支持千级适配器并发活跃
  • 打包MoE LoRA张量让实时加载速度提升 8.5-8.7倍

配套基础设施 MinT

MinT(Mind Lab Toolkit)让基座模型永远在线,适配器版本热插拔:

基座模型(永久驻留)

适配器生命周期:推出 → 更新 → 导出 → 评估 → 服务 → 回滚

并发多策略GRPO训练将墙钟时间缩短 1.77倍(密集模型)和1.45倍(MoE模型),不增加峰值内存。

三、使用了哪些模型和计算资源?

基座模型:

模型参数量
Qwen3系列0.6B ~ 235B(密集和MoE)
DeepSeek V3671B MoE
Kimi K2(Moonshot AI)1.04万亿总参数,激活32.6B,MoE

计算资源(万亿参数实验):

项目详情
GPU型号NVIDIA H800(80GB)
GPU数量8节点 × 8块 = 64块 H800
早期实验(671B)仅48块H800(6节点)
每步训练时间从9小时缩短至 1.5小时(提速6倍以上)
LoRA配置Rank=128,Alpha=256

实验结论数字:

  • AIME 2025推理基准提升:8.33% 到 20.61%
  • GPQA Diamond(跨域泛化):提升25.00% 到 33.02%

四、已落地应用

场景效果
医疗编码(实际医院部署)GPU成本降低 90%
1M用户个性化智能体每用户独立50B参数LoRA适配器
客户服务机器人客户满意度(CSAT)提升 34%
政府政务服务政策更新落地从数周缩短至 6小时

代码已集成进 NVIDIA NeMo Megatron-Bridge字节跳动 VolcEngine RL库

五、潜在应用场景

  • 个性化AI助手:每个用户的偏好、记忆和技能存储在私有LoRA适配器中,基座模型共享
  • 边缘设备部署:超轻量适配器可在手机等低算力设备上存储和加载
  • 企业定制模型:每个客户/部门维护独立适配器,基座共享,管理成本极低
  • 持续学习系统:用户的每次反馈都可以在线更新个人适配器,无需重训基座

六、网络上的评价与讨论

配套MinT论文(ArXiv: 2605.13779)在HuggingFace Papers当日排名第1,获219个赞,讨论热度高于本文。

社区技术关注点: MoE LoRA张量打包实现8.5-8.7倍更快实时加载;通过热/冷分离的多层缓存扩展到数千个适配器;基座模型永久驻留设计的实际工程价值。

七、思维导图

mindmap
  root((PEFT Scaling))
    核心范式重构
      PEFT从降低训练成本的工具
      重新定位为持久化个人模型的基础架构
      小型可训练适配器 = 持久本地状态
        存储实例特定偏好 技能 工具 记忆
        叠加在强共享基座之上
    三个规模化维度
      Scale Up 规模向上
        更强基座使小适配器更新价值更高
        基座越强 每个LoRA边际收益越大
      Scale Down 规模向下
        探索最小可靠适配器尺寸
        Rank-1配置下适配器可低于基座1%参数
      Scale Out 规模向外
        管理数百万并发个性化模型实例
        MinT支撑10的6次方级可寻址目录
    适配器架构与加速
      LoRA小型可训练适配器
        存储实例特定行为 尺寸可低于基座1%
      Adapter-only handoff性能
        4B密集模型 18.3倍步骤加速
        30B MoE模型 2.85倍步骤加速
      MoE LoRA张量打包
        实时加载速度提升8.5至8.7倍
    MinT基础设施框架
      管理适配器标识 版本 来源 评估 服务驻留
      张量并行部署 支持百万规模可寻址目录
      热冷分离多层缓存 扩展到数千个适配器
      基座模型永久驻留 适配器按需换入
      验证超过1T总参数
    落地案例
      医疗编码实际部署 GPU成本降低90%
      100万用户个性化智能体 每用户独立50B参数LoRA
      客服机器人 CSAT满意度提升34%
      政务服务 政策更新落地从数周缩至6小时
    代码集成
      NVIDIA NeMo Megatron-Bridge
      字节跳动 VolcEngine RL库

主要技术担忧: 并发适配器推出时的一致性问题——路由不断变化时如何避免缓存驱逐风暴。

Mind Lab提供公开平台(mint-console.macaron.xin),新用户赠送 500万tokens 免费额度,支持Qwen3全系列实验。