共 176 篇综述 · 按综述日期倒序排列
论文综述:文档检索感知分块 D-RAC
Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
D-RAC先把各种企业文档统一转成PDF再用多模态大模型一次性转成结构化Markdown,让后续分块几乎零成本且效果媲美昂贵的智能体式分块
论文综述:EvoOntology——为数据智能体打造的自我进化本体层
EvoOntology: A Self-Evolving Ontology Layer for Data Agents
让AI智能体不再死记数据表结构,而是通过一个会自我修正、自我进化的知识地图去查询和理解杂乱的表格、文件与数据库
论文综述:onPanda——用逐词修正高效标注大模型对齐数据
onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
onPanda用逐词定位修正代替整段重写来标注大模型对齐数据,标注时间中位数降低52%,并开源了Panda-CVL数据集与配套基准
论文综述:Paint-Anything,统一的任意颜色控制生成与编辑框架
Paint-Anything: Unified Any-Color Control for Image Generation and Editing
让AI画图和改图时能精确指定任意十六进制颜色值,误差控制在很小范围内,解决了以往AI生成图片颜色只能大概靠谱、不能精确匹配品牌色的问题
论文综述:RecreationWorld:面向图形界面与编程混合智能体的可扩展可验证环境
RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
让AI智能体一边操作运行中的软件一边动手写代码复刻它的五平台可验证测试环境与训练框架
论文综述:正则化递归自我改进智能体脚手架
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
提出RRSI方法,用预算限制和批评家剪枝器约束智能体脚手架的自我进化,减少对训练任务的过拟合,同时降低运行成本
论文综述:面向多人对话的说话人中心双轨记忆系统
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue
提出说话人中心的双轨记忆架构,用小模型强化学习训练的写入器把多人聊天记录整理成可检索的结构化记忆,显著提升长期多方对话问答准确率
论文综述:一变多,多归一——面向软件工程智能体的类别感知迭代式专家训练
One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents
论文提出按任务类别训练专家模型再融合的方法,让软件工程智能体在各类代码任务上均衡提升而非顾此失彼
论文综述:有品味的智能体——衡量并提升长时任务中的判断力
The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
提出Taste-Bench基准,用决策分叉点自动评测AI智能体在长任务中提前判断优劣方向的品味能力,并用师生蒸馏提升该能力
论文综述:基础模型时代的游戏 AI 全景综述
AI for Games in the Foundation Model Era
一篇120页综述,把基础模型在游戏全生命周期里的应用归纳成六大角色,并指出同一套模型能力在不同游戏里往往不能直接复用,需要重新验证
论文综述:Atria Dawn——智能体超级智能的黎明
Atria Dawn: The Dawn of Agentic Superintelligence
上海AI实验室发布744B参数智能体大模型Atria Dawn,探讨AI在科研工程中如何与人类分工协作
论文综述:Benchmark Radar——给 AI 评测基准做的实时数据库与搜索引擎
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
一个每天自动追踪37个信息源整理1283条评测基准记录的开放数据库与搜索引擎帮助研究者核查AI评测的真实来源与数据出处
论文综述:让持续学习机制组合起来,攻克长时程记忆遗忘
Continual Learning Mechanisms Compose for Long-Horizon Memorization
研究如何组合数据 功能 权重三种记忆锚点与LoRA低秩分配规则 让大模型连续学习100个任务后把记忆保留率从1.2%提升到34.9%
论文综述:DataFlex-RL——一个诚实评测 RLVR 数据策略效果的平台
DataFlex-RL: An Evaluation Platform for RLVR Data Policies
用统一实验平台严格对照测出多数RLVR数据筛选与重加权方法其实并不优于均匀采样的一篇负面结果论文
论文综述:Dream-RSI——在「演化世界」里做梦式自我改进
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
让AI智能体把已完成的探索记录变成可反复回放的模拟器,通过做梦式演练线下优化探索策略,再重新上线,从而大幅降低科学发现任务的搜索成本
论文综述:Feyospace-v1——七人团队如何训出前沿网络安全模型
Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models
七人独立团队用五套数据工程系统构建十六万余条可验证轨迹,训练出在CyberGym网络安全基准上进入前十的开源模型
论文综述:Grouped Value Attention——用按需重建 Key 的方式给 KV 缓存瘦身
Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction
提出Grouped Value Attention机制,只缓存分组后的value,推理时用可吸收进query的线性映射按需重建key,缓存量比GQA减少约45%到47%且精度接近
论文综述:LimiX-2——面向通用结构化数据智能的上下文机制网络
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
一个用上下文机制网络统一表格数据分类回归缺失值填补与因果发现的通用基础模型
论文综述:Occamy-1.0——面向协同办公的开源帕累托前沿35B智能模型
Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work
阿里Accio团队在Qwen3.6-35B-A3B基础上继续训练得到的协同办公智能体模型,用执行数据和分阶段后训练把成本与性能推到了帕累托前沿的低成本拐点
论文综述:重新审视 PPO 中的价值评论家学习——理解并缓解价值扁平化
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
揭示大模型强化学习中PPO价值评论家出现的价值扁平化现象及成因,提出仅监督少数状态的SP3O方法来修复价值预测并提升推理能力
论文综述:RSIAgent——不改参数、靠自主探索记忆适应新环境
RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
介绍RSIAgent如何用课程执行验证三类智能体自主探索新环境并把经验写成记忆,让开源大模型不修改参数就在部分测试中超过GPT-6等闭源模型
论文综述:SAS——通过端到端优化上下文排序实现简单的注意力稀疏化
SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
提出让大模型自己学会挑选重要历史信息的稀疏注意力方法SAS,在推理长文本和智能体任务上优于同类可训练方法
论文综述:ScienceIDE——把全世界的科研代码库变成智能体的学习环境
ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
把职业科学家维护的科研代码库自动改造成可执行验证的智能体训练环境,训练出的模型在科学代码修复和通用能力上都有提升
论文综述:ZGCM-1——完全开源的高效数学与智能体搜索基础模型
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
介绍从零训练的7.39B参数开源模型ZGCM-1,通过混合滑窗注意力、FP8 Muon优化器和渐进式长上下文训练,以更低算力逼近更大模型的数学与搜索能力
论文综述:干预引导的多智能体系统提示词优化
AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems
用顺序干预找出多智能体系统里真正出错的那个智能体,再把语义相似的文本梯度聚类抽象成通用改进方向,在五个基准上刷新成绩并把优化耗时平均缩短到原来的四成
论文综述:双层协调反思——多智能体大模型系统的博弈论方法
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
把多智能体大模型系统建模成双层协调博弈,证明只看文本的反思闸门存在信息论不可能性,并提出由环境验证器把关的 SRMA 记忆更新算法
论文综述:Dr. Claw —— 面向氛围研究的 AI 科学家工作台
Dr. Claw: An AI Scientist Workspace for Vibe Research
一个把命令行编程智能体包进可控可审计科研工作流的开源工作台,用四类持久化状态对象与技能库让人类始终掌握方向与验收权
论文综述:FlowBalance 基于验证器锚定的在策略推理经验自我改进
FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
用验证器给模型的稠密自我指导定方向,再用轨迹平衡把它拟合成完整回答上的归一化分布,让推理模型更稳更快地自我改进。
论文综述:Iris 攀登搜索智能体的性能前沿
Iris: Climbing to the Search Frontier
AllSpark 团队开源两款搜索智能体 Iris-mini 与 Iris-pro,用网页超链接反向造题加 SFT 与 RL 交替攀登训练,在四个搜索基准上刷新同参数量开源纪录
论文综述:通过下一概念预测走向潜空间语言模型
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
一个 8.9B 参数的语言模型在预测下一个词之外同时预测下一个概念,用一半训练数据追平 OLMo-3-7B
论文综述:用路由框架做智能体后训练,迈向递归自我改进
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
一篇把线上路由框架的执行日志变成训练数据的技术报告,用三阶段课程学习与在策略蒸馏让 4B 小模型逼近 9B 基座
论文综述:用在线策略反向蒸馏激发弱到强泛化
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
提取弱老师后训练学到的策略变化方向,只用它放大强学生自己的验证器策略梯度分量,不改变优化目标的不动点,从而又快又能超越老师
论文综述:用离散扩散为大模型解锁无损加速
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
给自回归大模型挂一组轻量扩散 LoRA 适配器,用 Psi-Spec 采样器并行出词再由原模型逐位验证,在输出分布完全不变的前提下把吞吐提到约 3 倍
论文综述:用世界模型把自动科研智能体的强化学习训练提速三到四倍
Scaling Automatic Research Agents via World Models
把强化学习里昂贵的真实环境执行换成学出来的世界模型,再用在线去偏和逆方差去噪两招修正误差,让自动科研智能体训练提速三到四倍。
论文综述:Aspire——只给一句含糊的目标,模型能自己进化吗?
Aspire: Can Models Self-Evolve from Vague Goals?
ByteDance Seed 的 Aspire 基准只给一句含糊能力目标 用 520 道隐藏考题检验智能体能否自己想清楚该学什么
论文综述:CoGR——让查询侧和商品侧的关键词生成器互相进化
It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
让两个 LLM 分别为查询和商品生成关键词 直接走倒排索引匹配 再用 GRPO 交替强化学习让两侧词表互相对齐
论文综述:DART-SD——别再逼智能体背诵整条轨迹了
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
把多轮工具调用建模成交互状态转移图 只在首个关键拓扑断点之后计算损失 让 8B 学生五个基准全面提升 其中三个反超教师
论文综述:EarlyEval——用两个决策树集成提前叫停智能体评测
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
用一对 LightGBM 成功失败分类器在智能体跑到一半时预判结局并叫停 省下 13% 到 26% 的步数和最多 44.1% 输入 token
论文综述:HarnessDev——大模型能不能自己造出、并且不断改进自己的智能体外壳?
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
把评测单位从任务输出换成可运行基础设施的基准 覆盖 6 个 creator LLM 4 个领域 5 个下游基准共 2207 个实例
论文综述:蒸馏其实没在蒸馏——OPSA 用模型自己的不确定性取代教师
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
实测发现 on-policy 蒸馏里教师信号三到五成是错的 真正起效的是压制低概率 token 于是提出完全不需要教师的 OPSA
论文综述:Repo-To-Skill——把一千个 GitHub 仓库蒸馏成智能体能用的技能库
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
把1000个机器学习仓库蒸馏成5000多个可验证技能 同一个GPT-5.5 Codex在MLE-bench上从31%涨到73%
论文综述:SMELT——把 MoE 的中间一半层跑两遍,在三重预算全对齐下省下 6.8% 到 18.0% 训练算力
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
在每 token FLOPs 非嵌入参数量和 KV cache 三项预算全部对齐的前提下 把 MoE 中间一半的层循环跑两遍 在算力最优前沿省下 6.8% 到 18.0% 的训练算力
论文综述:StudentSim——为每一个真实学生训练一个会被教会的分身
StudentSim: Training LLM-based Student Simulators
把每个学生的稀疏记录训练成一个专属模拟器 在国际象棋 二语写作 数学三个领域同时超过 GPT-5.4 还能当 AI 老师强化学习的奖励
论文综述:Terminal-Universe——把智能体轨迹倒放成可运行的终端环境
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
把已有智能体轨迹里的文件操作倒放还原成可运行环境 造出 37.3k 个环境和 32.0k 条训练数据 Terminal-Bench 2.1 提升 11.9 分
论文综述:Apodex 1.1 让 AI 真正干活而不只是回答
Apodex 1.1: Scaling Agentic Intelligence for Complex Work
通过扩展可执行环境与智能体协同两个维度训练模型完成真实长周期工作并交付可验证成果的技术报告
论文综述:AutoSaddler 让智能体外壳自动迭代进化
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
把智能体外壳当成代码来自动诊断与打补丁的框架,在三个长时程基准上把成功率提升约 9 到 10 个百分点
论文综述:扩散模型中的在线策略自蒸馏
On-Policy Self-Distillation in Diffusion Models
把只在最终图片上才有的奖励分数,翻译成每一步去噪都能听懂的具体目标,让扩散模型对齐训练又快又稳。
论文综述:什么样的智能体训练数据才算好数据
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
一篇系统梳理大模型智能体训练数据生成的综述,提出用准确性、复杂度、多样性三维视角判断什么样的数据才真正有用
论文综述:LLM 智能体时代的图工程——从个体智能到系统智能
Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence
一篇提出 Graph Engineering 范式的综述,主张用显式图结构组织任务、智能体与运行时状态,把单体智能升级为系统智能
论文综述:JIT-Agent——通过即时脚手架进化扩展驾驭层智能
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
把智能体的运行脚手架本身变成可学习对象,训练一个 27B 元模型现场生成、修复并持续进化任务专属 harness。
论文综述:Prime Agent——一个会自我改进的递归语言模型外壳
Prime Agent: A Self-Improving RLM Harness
一个开源的长程智能体外壳 用持久 IPython REPL 递归子智能体和可自我改写的 Continual Harness 把 ARC-AGI-3 成绩从 30% 推到 95.5%
论文综述:TTPO:没有标准答案也能继续变强的测试时策略优化
TTPO: Test-Time Policy Optimization
不依赖标准答案,用多数投票伪标签在测试时继续训练模型,靠非对称目标兼顾蒸馏与惩罚,把 Qwen3-1.7B 的数学平均分从 38.0 提到 45.2
论文综述:重新思考可扩展离线策略强化学习中的探索与利用
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
当仿真数据从稀缺变得海量 离线策略强化学习里那些老牌稳定器反而成了拖累 WarpSAC按数据规模开药方
论文综述:Agentic ESOpt 用进化策略以最小显存微调长时程 LLM 智能体
Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
用进化策略取代反向传播做长时程 LLM 智能体的全参数微调,训练显存降到推理级别,在数独、数学、DocVQA、WebArena-Lite 与启发式设计上超过 GRPO 与 PPO
论文综述:Co-RL 让多个不同的模型互相打分,无监督推理能力就此涌现
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
让多个不同家族的模型在强化学习中互相打分,不用任何人工标注标签就能提升推理能力,同时避免自我强化导致的训练崩塌
论文综述:EnvHarness——唤醒静态世界,为智能体学习而生的可编程环境包装层
EnvHarness: Awakening Static Worlds for Agent Learning
谷歌等团队提出 EnvHarness,用可插拔包装层把静态基准环境改造成随智能体弱点动态定制的训练环境,五个基准上最高提升 9.0 点
论文综述:FreeToken 让个人电脑跑起前沿 MoE 大模型的边缘原生服务系统
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
把个人电脑当成统一弹性推理平台的边缘 MoE 服务系统,用实测带宽动态划分 PCIe 传输与 CPU 执行,让 8GB 笔记本跑 35B、单张工作站卡跑 753B
论文综述:大发现模型,以实验数据为锚的模型化开放式搜索
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
把大语言模型当候选提案机、把高斯过程当带不确定性的价值裁判,让二者互相纠正,在程序、抗体、分子三类开放设计空间里做少次数高价值的实验搜索。
论文综述:OmniScientist 一个全模态全学科的 AI 科学家
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
让 AI 科学家直接看原始数据而不是别人算好的数字,在 36 个真实数据集上从原始证据一路跑到成稿论文
论文综述:自监督视觉在线策略蒸馏
Self-Supervised Visual On-Policy Distillation
不给老师开特权而是给学生降级 只对学生视图做强增强就能免费造出师生不对称 让 4B 模型的细粒度感知超过 235B 开源模型
论文综述:只学还没学会的,别再学已经学会的——多奖励策略优化中的饱和感知优势重加权
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
SA-MRPO 让每个奖励目标各自标准化并按饱和度自动打折把梯度预算从已经做满的目标挪给还有提升空间的目标
论文综述:StateM 用外壳扩展在 Terminal-Bench 2.1 上做到 95.3% 原始准确率
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
不改模型权重,只把 agent 外面的执行系统做成可持久化状态机,就把终端任务成功率从 83.1% 推到 95.3%,最终跑分只花约 15 美元。
论文综述:测试时的 AI4AI —— 通过外壳实现从强到弱的能力迁移
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
强模型不改弱模型的权重,只在推理时为它搭建一套代码外壳,就把四个心智理论基准的平均准确率从 0.49 拉到 0.91。
论文综述:BDH-CQ 用循环潜在推理做上下文学习
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
一个 1.5 亿参数的后 Transformer 模型不写思维链,靠循环潜在状态在 ARC-AGI-1 上拿到 29.5% pass@2,每题只花 0.0007 美元
论文综述:智能体系统中的协同进化——迈向超越人类设计的自主进化
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
一篇系统梳理智能体协同进化的综述,提出智能体间、智能体与环境、元协同进化的三阶段递进分类体系
论文综述:ComBodied Agents——以人为中心的智能体 AI 新范式
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
提出以人的状态轨迹为建模与评估对象的智能体新范式,用感知、记忆、个人世界模型与可准入干预构成闭环,强调能动性保全。
论文综述:DarwinX——用自然选择进化智能体的运行骨架
DarwinX: Evolving Agent Harnesses Through Natural Selection
模型权重完全冻结,只让提示词、工具、技能与控制流在种群选择中进化,靠保留并扩展契约防止旧能力退化。
论文综述:LLMRouter——开发、评测与部署大模型路由器的统一基础设施
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers
统一大模型路由的五部件形式化框架,配套 xRouteBench 基准与 16 个以上路由器的开源实现,学习型路由相对最强固定模型基线提升 14.6%
论文综述:Macaron-V1 面向开放持续学习的自我改进与 LoRA 混合体
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Lab 用冻结大底座加四个 LoRA 专家的路由式架构,配合模型与运行环境联合训练的自我改进闭环,做出可持续升级的开放智能体模型 Macaron-V1
论文综述:Mechanist——把 AI 当作科学仪器,去发现智能自身的机制
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
浙大等团队提出 Mechanist 智能体系统,用知识图谱与 32 种可解释性方法自动生成假设并做因果干预,发现跨模态潜隐特质传递、信念表征机制,并引导 DNA 序列生成。
论文综述:OpenART——用开放式环境演化把智能体红队测试做到规模化
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
把红队测试的对象从单条提示词换成可执行、可持续演化的环境,覆盖 10K 场景与 75 种智能体模型组合,严格攻击成功率达 85.0%。
论文综述:衔尾蛇——一个通过受审提交改写自身内核的前沿编码智能体
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
Ouroboros 让智能体通过受审提交改写自己的工具、提示词与核心实现,在多项基准刷新纪录,并给出一次长达 161 天的真实部署记录。
论文综述:SFT 会打架,RL 能共存——大模型多任务学习的理论与实证分析
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
揭示多阶段 SFT 因梯度范数过大而任务互相冲突,RL 更新稀疏近正交可以共存,并据此提出 Parallel-RL 并行训练范式
论文综述:SkillZip——面向可扩展智能体技能库的契约保持式图压缩
SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
把智能体技能库当成图来压缩,用可逆宏替换重复流程片段,同时保住接口、依赖与验证器,实现 3.46 倍压缩与 99.2% 依赖保全。
论文综述:从灵感到论文——把端到端论文生成做成可组合技能
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
把端到端论文写作拆成十三个可组合技能装进编码助手,用确定性校验与自我反驳循环约束换来99.5%引用有效率和8.1美元一篇的成本
论文综述:从商业大模型 API 中窃取推理轨迹
Stealing Reasoning Traces from Proprietary LLM APIs
揭示主流大模型 API 的加密推理块可跨会话跨用户跨模型重放,用弱模型当解密预言机还原隐藏思维链,并从公开日志中恢复出真实凭证与个人信息
论文综述:SWE-Bench ProMax——在大规模多语言代码重构上评测智能体
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
一个由专家策展的多语言代码重构基准,170 个实例覆盖七种语言,前沿模型最高只解决 41.2%。
论文综述:完全无监督的在线策略自蒸馏
On-Policy Self-Distillation without Any Supervision
一种不依赖任何外部监督的在线策略自蒸馏方法,用多数投票伪答案作为自己的老师,在 Qwen3 数学推理上超过有标注的 OPSD 与 GRPO。
论文综述:AURORA-LM——用连续潜空间做扩散式语言生成
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
提出AURORA-LM,用查询式编解码器构造高容量连续文本潜空间,再用分块因果扩散模型学习其分布,实现更强的文本生成效果
论文综述:双锚定策略蒸馏,让学生模型不再依赖考试作弊
DAPD: Dual-Anchored Policy Distillation
论文提出DAPD方法,通过双重锚定机制解决语言模型自蒸馏训练中学生偷看参考答案却在考试时用不上的特权幻觉问题
论文综述:LongHorizon-Harness:让大模型智能体真正做完长任务
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
阿里团队提出LongHorizon-Harness框架,用管理-执行-审计三角色循环把任务状态和执行过程分离,大幅提升大模型在长任务上的完成率
论文综述:面向长程终端任务的递归合成框架
Recursive Synthesis for Long-Horizon Terminal Tasks
提出RST框架,从种子任务出发递归改写解决方案来自动生成越来越难的终端任务,用于训练更强的命令行智能体
论文综述:从RLVR到RLSVR:用任务变换让开放式任务也能自我验证奖励
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
让大模型玩狼人杀式找卧底游戏,用投票结果作为可验证奖励,把摘要写作等开放式任务也变成能自我训练的题目
论文综述:CodeNib——给编程 AI 造一套多视角代码检索系统
CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
CodeNib为编程AI智能体建立词法、向量、结构三种代码索引视图,让代码库改动后能快速增量更新索引并精准定位代码,同时大幅减少智能体读取代码时消耗的token
论文综述:CoRT——用反事实回放给每个字打分的规则奖励强化学习
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
ByteDance提出CoRT方法,用反事实回放对比同一回答在有无评分细则提示下的逐词概率差异,把笼统的整句奖励拆分到每个词元上,从而提升大模型的指令遵循能力
论文综述:让AI自己出题又自己答题,DecoEvo如何靠拆分打分权来防止作弊
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
论文提出DecoEvo方法,让答题技能和出题评分技能在文本层面各自独立进化,避免评分标准被悄悄放水,从而在多个基准上稳定超过现有方法
论文综述:让AI学会训练AI——Frontis-MA1的机器学习工程自我进化之路
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Frontis AI提出开源系统OpenMLE,训练35B模型Frontis-MA1学会像专家一样自动改进机器学习工程方案,性能超越GPT-5.5加Codex的组合
论文综述:给大模型装上内置记忆——Metis 记忆基础模型
Metis: Memory Foundation Model
提出把持久记忆状态直接内置于模型骨干网络的Metis原型,用记忆注意力替代外部记忆模块管理长期上下文
论文综述:用结构化协议把闭源大模型的搜索能力蒸馏进开源小模型
From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
论文提出用结构化JSON协议作为中间表示,把闭源大模型的搜索推理能力蒸馏进开源小模型,在多跳问答任务上取得明显提升
论文综述:让相关性来指挥搜索——RARG如何用grep式检索加速智能体搜索
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
腾讯团队提出RARG智能体,让相关性分数不再只是挑选文档的门槛,而是全程指挥ripgrep式检索的顺序与取舍,从而更快更准地找到答案证据
论文综述:AREX——面向深度研究的递归自我改进智能体
AREX: Towards a Recursively Self-Improving Agent for Deep Research
提出AREX智能体通过内外双循环和历史压缩实现递归自我改进在深度研究类基准上大幅超越同规模模型
论文综述:DataFlow-Harness——让代码智能体搭出可编辑的LLM数据流水线
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
让代码智能体不再只写一次性脚本,而是通过MCP协议和技能库把数据流水线固化成可复用可编辑的DAG
论文综述:DeepSearch-World:可验证环境中深度搜索智能体的自蒸馏方法
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
提出42万题可验证维基百科环境与自蒸馏训练框架,让9B模型无需依赖更强模型蒸馏即可自我进化为深度搜索智能体
论文综述:EvolvingWorld——角色智能体与世界模型的开放式属性协同演化框架
EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
让角色智能体与世界模型在长篇小说场景里互相驱动、持续更新彼此状态的开放式属性框架及配套评测基准
论文综述:GigaAM Multilingual:面向弱势语言的语音基础模型
GigaAM Multilingual: Foundation Model for Underrepresented Languages
面向哈萨克语吉尔吉斯语乌兹别克语等弱势语言的开源语音基础模型,用聚类级数据平衡和领域感知采样大幅降低识别错误率
论文综述:Loop the Loopies——用层循环让MoE模型「以小博大」
Loop the Loopies!
提出层循环的Loopie系列MoE模型,在同等预训练算力下超过普通Transformer基线,并通过强化学习获得较强推理能力
论文综述:RAGU——用紧凑领域适配小模型构建的多步GraphRAG引擎
RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
用两阶段抽取和实体去重模块构建知识图谱,配合自研70亿参数小模型Meno-Lite实现低成本高质量的GraphRAG检索问答
论文综述:SWE-Pruner Pro:编程智能体的大脑里早就知道该删什么
SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
让编程智能体用自己已有的隐藏状态判断工具输出里哪些行该保留哪些该删除,从而节省高达39%的token
论文综述:函数感知的填空式训练——为编程智能体基础模型设计的中间训练阶段
Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
提出函数感知的填空训练法,利用函数调用与智能体行动-观察循环的结构相似性,在中间训练阶段提升编程智能体能力
论文综述:智能体脚手架说明书——让不断进化的Agent Harness可读、可导航、可编辑
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
一篇提出为复杂智能体脚手架自动生成行为地图的论文,帮助人类和AI更快找到该改哪里的代码并写出更准确的修改方案
论文综述:LongStraw:固定GPU预算下突破200万Token的长上下文强化学习
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
一篇系统工程报告,讲述如何在不增加GPU数量的前提下,通过只保留必要状态和串行重放的方式把GRPO强化学习训练的上下文长度做到200万Token以上
论文综述:OvisOCR2 技术报告——用0.8B小模型刷新文档解析榜单
OvisOCR2 Technical Report
阿里团队用0.8B端到端多模态模型OvisOCR2,把文档图片直接转成结构化Markdown,性能超越多种大模型和OCR流水线方案
论文综述:Ring-Zero——把零标注强化学习扩展到万亿参数,涌现出会自己思考的推理能力
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
蚂蚁集团把无需人工标注的零强化学习训练扩展到万亿参数模型Ring-2.5-1T-Zero上发现规模越大越容易涌现出自我验证等高级推理行为
论文综述:搜索超越可教之知——在智能体式视觉生成中进化知识边界
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
研究图像生成模型面对新角色和最新事件时会自信地编造错误内容的问题,提出用可训练的知识边界来决定何时该检索外部信息
论文综述:SearchOS-V1:面向鲁棒开放域信息检索的智能体协作系统
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
提出SearchOS框架,把多智能体网页搜索中易丢失的隐式进度变成显式共享状态,显著减少重复搜索循环并提升信息完整性
论文综述:SEED:面向智能体强化学习的自我进化在线策略蒸馏
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
让大模型智能体自己总结经验教训并把这些经验转化为逐词训练信号,从而更高效地学会多步任务
论文综述:借小模型的RL经验教大模型——直接在策略蒸馏实现弱到强泛化
Weak-to-Strong Generalization via Direct On-Policy Distillation
提出Direct-OPD方法,把小模型RL训练学到的策略变化当作隐式奖励直接迁移给大模型,几小时内显著提升大模型数学推理能力
论文综述:HiLS分层稀疏注意力——让AI真正学会“该重点看哪一块”
Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
腾讯混元团队提出HiLS分层稀疏注意力机制,让模型自己学会挑选该重点关注的文本块,训练8K上下文却能外推到400万token,还能给已有模型做轻量续训升级
论文综述:训练策略优化的"海市蜃楼"——LLM强化学习真正该盯住的是"推理策略"
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
指出LLM强化学习训练中一个被忽视的目标错位问题:训练侧策略变好,不等于部署时实际用的推理策略也变好,并提出新的优化目标和两步更新框架来纠正它
论文综述:OmniOpt——给100多种现代优化器建一张统一的坐标系地图
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
把AdamW、Muon、Lion等100多种五花八门的大模型优化器,统一拆解成同一套五阶段流程和两个分类维度,再用统一基准跑分,做成一本优化器选型指南
论文综述:ResearchStudio-Idea——从近2000篇顶会论文里炼出的科研选题工具
ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
分析近2000篇ICLR/ICML/NeurIPS会议论文(含被拒稿件),归纳出15种可复用的科研选题套路,做成一套能自动查文献、找瓶颈、查重、审计的AI选题助手
论文综述:ResearchStudio-Reel——把一篇论文自动变成海报、视频和双语博客
ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
微软研究院团队用Claude Code和Codex构建的五个Agent技能,把一篇论文自动加工成可编辑的海报、讲解视频和中英双语博客,且质量在多数论文上超过作者本人手工制作的海报
论文综述:智能体的弃权之道:Agent 到底知不知道该停手
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
研究AI智能体在任务不可行时能否及时停手而不是硬着头皮乱操作,提出新基准和名为CONVOLVE的经验积累方法来提升智能体的知止能力
论文综述:AgenticSTS——给长程AI智能体的有界记忆试验场
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
一篇用卡牌游戏当考场的论文,把AI智能体的记忆设计成可拆卸的模块,逐层测试到底哪一层记忆真正管用
论文综述:拉长视野而非堆参数——用35B智能体追平万亿参数模型
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
上海AI实验室提出35B参数的Agents-A1智能体模型,通过延长任务执行的时间跨度而非扩大参数规模,在多项长程智能体基准上追平甚至超过万亿参数模型
论文综述:BlockPilot——为扩散式投机解码学会因材施教的自适应策略
BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding
一种让扩散式投机解码根据每条输入自动挑选最优分块大小的轻量策略网络,在Qwen3-4B上实现4.20倍推理加速
论文综述:Dockerless——不用搭建代码环境的编程智能体验证器
Dockerless: Environment-Free Program Verifier for Coding Agents
提出无需为每个代码仓库搭建Docker环境的智能体式补丁验证器,用它筛选训练数据和提供强化学习奖励,效果接近传统方案
论文综述:DOPD——双路在线策略蒸馏
DOPD: Dual On-policy Distillation
提出DOPD方法,让小模型在向大模型学习时按每个词元的真实能力差距动态切换老师和自己作为监督来源,从而更高效地缩小大小模型之间的能力差距
论文综述:EvoPolicyGym:评估交互环境中的自主策略进化能力
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
一个评估AI编程智能体能否在有限反馈下持续改写可执行策略代码的新基准,发现GPT-5.5在16个环境中综合表现最强
论文综述:形式化潜在思维——大语言模型思维表征的四条公理
Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs
提出四条公理来检验大模型内部潜在思维表征是否真的承载了有意义的推理过程,发现现有方法全部不及格
论文综述:程序即权重——模糊函数的编程新范式
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
把用自然语言描述的模糊功能编译成一份23MB的神经网络权重文件,让0.6B小模型在本地运行就能达到32B大模型调用API的效果
论文综述:ReFreeKV:迈向无阈值的KV缓存压缩
ReFreeKV: Towards Threshold-Free KV Cache Compression
提出无需为不同任务手动设定压缩比例的KV缓存压缩新方法ReFreeKV用统一阈值自适应决定每条输入该保留多少缓存
论文综述:我们准备好迎接智能体原生的记忆系统了吗?
Are We Ready For An Agent-Native Memory System?
一篇从数据管理视角系统评测智能体记忆系统的论文,把记忆拆成四大模块,横评12个系统,结论是没有万能架构、好坏取决于记忆结构是否对齐工作负载瓶颈
论文综述:跳出自我确认陷阱——面向智能体经验学习的执行-蒸馏-验证范式
Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning
提出执行-蒸馏-验证(EDV)范式,用多个异构智能体并行探索、第三方蒸馏与共识验证,避免智能体把错误但自洽的轨迹当成成功经验写入记忆,从而提升智能体长期学习的可靠性
论文综述:分组查询专家——在 GQA 自注意力上引入混合专家
Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention
一种在 GQA 自注意力的查询头上做混合专家路由的方法,每个 token 只激活部分查询头,在保持精度的同时降低注意力计算开销。
论文综述:KaLM-Reranker-V1 面向压缩文档重排的快速非延迟交互
KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking
提出一种把查询与文档计算解耦的高效重排器,通过离线预编码文档加交叉注意力,在大幅提速十倍以上的同时保持接近顶尖工业重排器的检索效果。
论文综述:OpenThoughts-Agent——面向智能体模型的数据配方
OpenThoughts-Agent: Data Recipes for Agentic Models
通过 100 多次消融实验系统化地探索如何为智能体模型挑选训练数据,给出可复现的开源数据配方,用 10 万条样本微调 Qwen3-32B 在七个智能体基准上取得 44.8 分。
论文综述:OPID 用在线技能蒸馏强化智能体
OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
从智能体自己跑出来的轨迹里提炼分层技能并蒸馏回模型,把稀疏的成败奖励变成密集的逐词指导,让语言智能体学得更快更稳
论文综述:无限 OCR——开启一次前向解析长文档的时代
Unlimited OCR Works
百度提出的端到端 OCR 模型,用参考滑动窗口注意力把 KV 缓存压成常数,一次前向解析几十页文档,在 OmniDocBench 上超越 DeepSeek OCR。
论文综述:VibeThinker-3B 用 3B 小模型逼近顶级推理水平
VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models
一个仅3B参数的小模型,靠精心设计的后训练流程,在数学和编程等可验证推理任务上逼近甚至追平几百倍大的顶级模型
论文综述:数据记者智能体——把数据变成可验证的多模态故事
Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories
一个名为Data2Story的多智能体框架,像一个虚拟编辑部一样把原始数据自动变成有据可查、图文音视频并茂的新闻报道,并让每个数字都能追溯到源头代码或资料
论文综述:只循环一次——高效测试时计算扩展的并行循环 Transformer
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling
一篇研究循环 Transformer 的论文,发现让 7B 代码模型把同一组网络层重复跑两次效果最好,再多反而变差,并系统解释了为什么只需循环一次额外计算
论文综述:APPO 用分支分数把智能体强化学习的功劳分配做到词级
APPO: Agentic Procedural Policy Optimization
提出智能体过程式策略优化APPO,用结合token熵与下游影响力的分支分数定位关键决策点,并用过程级优势缩放把功劳分配下沉到词级,在Llama3.1-8B与Qwen2.5-7B上横跨13个基准平均提升约4分
论文综述:MRAgent 让大模型智能体像人脑一样重建记忆而非检索记忆
Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents
提出MRAgent框架,把记忆组织成线索-标签-内容关联图并分情景语义主题三层,用主动重建机制让大模型边推理边在图中多步探索,在LoCoMo与LongMemEval上最高提升约23%且大幅降低token与时间成本
论文综述:FORT-Searcher:合成抗捷径的搜索任务来训练深度搜索智能体
FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents
提出 FORT 框架,通过识别并消除四类搜索捷径来合成真正需要多步检索的训练任务,仅用监督微调就让深度搜索智能体在 BrowseComp 等基准上达到领先表现。
论文综述:通过假设树精炼迈向通用自主科研
Toward Generalist Autonomous Research via Hypothesis-Tree Refinement
提出 Arbor 框架,用一棵持久的假设树把零散的实验尝试组织成可累积的科研过程,让 AI 智能体在六项真实科研任务上显著超越 Codex 与 Claude Code。
论文综述:想象式感知 Token 增强多模态语言模型的空间推理能力
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
一种让多模态模型先在脑中画出看不见的视角图像再回答的方法,用视觉而非文字进行空间推理,效果优于文本思维链
论文综述:交错思考者——用强化学习驱动智能体式图文交错生成
InterleaveThinker: Reinforcing Agentic Interleaved Generation
一个让普通图像生成器学会一边画图一边思考的多智能体框架,用规划者和评判者两个角色加上强化学习,实现高质量的图文交错生成。
论文综述:用流形幂迭代重新设计混合专家路由器
Redesign Mixture-of-Experts Routers with Manifold Power Iteration
一种用幂迭代让混合专家路由器对齐专家权重主奇异方向的方法,可加速收敛、提升下游表现并改善负载均衡。
论文综述:你的解嵌入矩阵其实是文本嵌入的一面特征透镜
Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings
一种无需训练的线性变换方法 EmbedFilter,通过解嵌入矩阵这面透镜过滤掉高频无信息词子空间,让大模型生成的文本嵌入质量最高提升约14%,并支持降维。
论文综述:激活引导的几何解释——角度与范数的解耦分析
A Geometric Account of Activation Steering through Angle-Norm Decomposition
提出角度-范数分解框架统一分析六种激活引导方法,证明概念信息储存于向量方向(角度分量)而非长度(范数分量),范数控制生成稳定性;发现Adam NDS是Muon的1.76倍主要来自曲率惩罚差异,为激活引导提供可操作的双旋钮调参理论
论文综述:Bayesian-Agent 用贝叶斯后验驱动LLM智能体技能进化
Bayesian-Agent: Posterior-Guided Skill Evolution for LLM Agent Harnesses
提出用因子化类别贝叶斯后验模型维护每个技能的可靠性置信度,根据后验状态触发探索/修补/拆分/压缩/退役五种离散操作,在SOP-Bench上将Agent成功率从80%提升至95%,无需修改任何模型权重
论文综述:FlashMemory-DeepSeek-V4 用前瞻稀疏注意力压缩超长上下文KV缓存
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
提出前瞻稀疏注意力(LSA)框架,通过轻量级神经记忆索引器提前预测下一批次所需历史KV块并异步预取,将500K超长上下文的KV缓存显存从7.79GB压缩至0.77GB(节省90%),同时在主流长文本基准上精度不降反升0.6%
论文综述:合成语法推理轨迹辅助低资源机器翻译
Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?
提出自动化三步流水线将Universal Dependencies树库中的句法标注转化为步骤化语法推理轨迹,系统验证ICL/SFT/RFT三种使用方式对锡伯语和Chintang 语低资源翻译的效果,发现ICL最有效可使chrF提升最高11.89点,总计消耗约2000 GPU小时
论文综述:LatentSkill 把LLM智能体技能编译为权重空间LoRA
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
提出超网络驱动的技能编译器,将LLM智能体的文本技能编译为权重空间LoRA适配器,消除上下文技能开销,在ALFWorld任务成功率提升21.4点的同时减少64%Token消耗,并将对抗提示词注入攻击的防御能力提升4.5倍
论文综述:Lean4Agent 用形式化验证保证AI智能体工作流的正确性
Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory
提出FormalAgentLib(151类型/611函数)和LeanEvolve,首次将Lean4依赖类型系统引入LLM智能体工作流验证,通过结构-语义-轨迹三层验证在SWE-Bench-Verified困难子集上提升14.80个百分点,跨越5个主流LLM模型验证通用性
论文综述:为什么Muon优于Adam——来自曲率的几何解释
Why Muon Outperforms Adam: A Curvature Perspective
首次用二阶泰勒展开和归一化方向锐度(NDS)指标,从曲率角度严格证明Muon优于Adam的根本原因:Adam每步遭遇的归一化方向锐度是Muon的1.76倍,导致更大的曲率惩罚,而数据不均衡程度越高这一优势越显著,已在Kimi K2等万亿参数模型上落地验证
论文综述:在线策略蒸馏的几何结构分析
On the Geometry of On-Policy Distillation
首次从参数空间几何角度解剖在线策略蒸馏(OPD),发现训练约20%进度后更新锁定在约16维的稳定低秩子空间,且这一几何结构由训练目标组合决定,为DeepSeek-V4等顶级模型所用的OPD范式提供了系统性机制解释
论文综述:PBSD 用特权贝叶斯自蒸馏解决长时信用分配
PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment
提出特权贝叶斯自蒸馏框架,用贝叶斯定理将轨迹级成功概率转化为逐步证据得分,以此调整GRPO梯度权重实现精细信用分配,在BrowseComp多轮网络搜索任务上以Qwen3-30B-A3B实现困难题成功率从2.25%提升至4.50%
论文综述:SEE 用160条样本唤醒基础大模型的潜藏自评能力
Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data
提出SEE两阶段训练框架,发现基础LLM已内置对外部裁判评分的预测能力,仅用160条训练样本和约300 GPU小时将Qwen3-4B-Base的HelpSteer2校准得分从0.632提升至0.731,数据效率约为基线方法的31倍,且自评能力可泛化至未见过的Claude和Gemini裁判
论文综述:文生图模型对文本编码器的上下文信息依赖远低于预期
Text-to-Image Models Need Less from Text Encoders Than You Think
提出三种递进的无上下文嵌入构造方法(BoT/BoW/BoPTW),证明现代Diffusion Transformer架构(FLUX/SD3)中图像模型本身已具备语言理解能力,仅需位置化词袋嵌入即可达到完整嵌入65%以上的图像质量,而旧U-Net架构完全失效
论文综述:COLLEAGUE.SKILL 专家知识蒸馏自动生成AI技能包
COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation
从飞书/钉钉/邮件等异构数据中自动提炼人类专家的隐性知识,生成可携带、可检查、可组合、可纠错、可治理的AI技能包(SKILL.md),5天获6600+Stars,引发中国科技圈广泛讨论
论文综述:Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
Domino 将投机解码的因果建模与自回归草稿解耦,通过轻量 GRU 修正头在保持并行速度的同时注入因果依赖,在 Qwen3-8B 上实现平均 5.49× 推理加速。
论文综述:DRIFT 框架追踪深度研究Agent在哪一步跑偏
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
发现36.9%看似成功的Agent轨迹实际包含错误跨度;TELBench数据集(1000条专家标注轨迹,300+小时)+ DRIFT三阶段声明审计框架(Claim Keeper/Support Seeker/Dependency Tracer),将各模型错误检测F1提升17-33个百分点,但首错定位准确率仍仅约24%
论文综述:GrepSeek 训练搜索智能体直接与语料库交互
GrepSeek: Training Search Agents for Direct Corpus Interaction
训练9B语言模型像程序员用grep搜代码一样直接用Shell命令搜文档,无需建向量索引,多跳推理任务(2WikiMultihopQA)比最强基线 Search-R1 高出 +8.8 pp,配套7.6倍加速的并行执行引擎,全部开源
论文综述:Harness-1 把搜索状态外置让RL专注策略的20B搜索Agent
Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
把状态管理从语言模型剥离交给环境(harness)维护,策略只专注五个语义决策(搜什么/看什么/留什么/验什么/何时停),仅用899条SFT+3453条RL数据,20B模型在8个基准上以0.730平均召回率超越GPT-5.4,超过下一名最强开源Agent +11.4pp,X平台获13.4万次浏览
论文综述:遮盖过时观测助力搜索Agent——直到它不再有效
Masking Stale Observations Helps Search Agents -- Until It Doesn't
系统研究「遮盖过时观测」对搜索Agent的效果,发现不对称倒U形曲线:强检索器+中等模型时显著有效,强检索器+超强模型(DeepSeek-V4-Flash 284B)时反而有害;提出「token换轮次」机制解释,覆盖4B到284B模型、3种检索器、4个基准(英中双语)
论文综述:OCC-RAG 为忠实问答打造的最优认知核心小模型
OCC-RAG: Optimal Cognitive Core for Faithful Question Answering
用325万条合成数据对Qwen3-0.6B/1.7B做中间训练,在忠实问答、多跳推理、拒绝能力上全面击败2-6倍大的通用模型;0.6B模型在ConFiQA忠实性指标上超越6.7倍大的Gemma3-4B,拒绝能力从6.3分跃升至86.9分
论文综述:A Matter of TASTE 自动生成更难更全面的 Agent 基准测试
A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks
TASTE 框架将基准生成流程反转——先从工具调用序列出发再推用户故事,结合自适应对比n-gram建模和迭代难度演化,令 Gemini-3-Flash 从 0.94 跌至 0.61,工具覆盖度最高提升124%,全套成本仅约1245美元
论文综述:Trust-Region Behavior Blending 让在线蒸馏早期训练更稳定
Trust-Region Behavior Blending for On-Policy Distillation
提出 TRB 热身策略,在 OPD 早期训练阶段用几何平均混合学生/教师分布,限制在以学生为中心的 KL 信任域内,有闭合形式解,无需额外梯度下降,可即插即用进任何 OPD 训练流程;在 Qwen3 模型对上超越 Veto、SKD 等多个基线
论文综述:Crafter 多智能体科学图表自动生成框架
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
提出多智能体总控框架Crafter,通过规划-审查-结构化纠错的协作机制自动生成可编辑的学术科学图表,附CraftEditor将光栅图转SVG,在评测上领先竞品16-22个百分点
论文综述:FineVerify — 精细化自我验证让AI搜索超越旗舰大模型
FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search
提出FineVerify框架,将复杂问题拆成可独立核查的子问题并逐条判断证据,解决智能体搜索中多次采样后选最优答案的可靠性问题;GPT-5-mini采样12次即超越GPT-5旗舰模型单次准确率,代码已开源
论文综述:多智能体强化学习何时能提升LLM工作流?
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
系统研究多智能体RL训练LLM工作流的有效性条件,发现并命名两种训练崩溃机制(梯度放大和角色捕获),给出工作流拓扑、模型规模与策略共享方式的实用决策指南
论文综述:NITP — 用隐式Token预测修复大语言模型的表示退化
NITP: Next Implicit Token Prediction for LLM Pre-training
ICML 2026接收。在标准NTP训练目标之外增加一个隐式语义对齐辅助损失,仅约+2%额外计算开销,系统性修复大语言模型隐藏层表示退化,在0.5B到9B规模模型上一致提升推理、理解和语义嵌入能力
论文综述:PEFT规模化 — 迈向万亿参数的百万个人模型
On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters
从三个缩放维度(向上/向下/向外)系统研究PEFT规模化规律,首次在超过1万亿参数模型上验证LoRA强化学习,实现适配器传输速度提升18.3倍,配套MinT基础设施已服务百万用户
论文综述:DVAO 动态方差自适应优势优化
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
针对多目标强化学习场景,以各奖励在当前批次的方差为权重动态调整优化方向,解决了 GRPO 多奖励合并时训练不稳定和固定权重的缺陷
论文综述:Macaron-A2UI 个人 AI 代理的生成式界面
Macaron-A2UI: A Model for Generative UI in Personal Agents
提出让 AI 在对话中动态生成可交互界面元素的完整方案,包含数据集、评测基准和训练流程,235B 模型在不依赖协议文档的情况下超越获得完整文档提示的 GPT-5.4
论文综述:ProRL 主动推荐系统的强化学习优化
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
提出两个修正机制解决主动推荐系统强化学习训练时的长度捷径偏差和高梯度方差问题,仅197万参数即超越8B规模的LLM方案,已被ICML 2026接收
论文综述:SciAtlas 面向自动化科研的大规模知识图谱
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
整合4300万篇学术论文构建含30亿条关系的知识图谱,通过三路径协同召回加图重排序实现拓扑推理级别的学术检索,2分钟内返回结果并已开放API访问
论文综述:CausaLab
CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists
专门测试 AI 大模型能否真正做科学实验发现因果规律的测试平台。结论令人警醒:哪怕最强的 GPT-5.2-high,大多数时候也只是猜对了答案,并没有真正搞懂背后的因果机制。
论文综述:模型该什么时候改变主意?
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
揭示 AI 大模型在多轮对话中的信念管理几乎全部失败,并提出 BeliefTrack 测试平台和基于强化学习的改进方案,将失败率降低 70.9%。
论文综述:minWM
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
把慢速视频生成模型改造成实时交互世界模型的完整开源框架,速度提升 200+ 倍,相当于一个 AI 游戏引擎的雏形。
论文综述:OmniRetrieval
OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources
让 AI 像全能图书馆员一样,用 SQL、SPARQL、Cypher 等各种原生语言同时查询异构知识库,无需统一格式转换。
论文综述:密集检索器中的位置偏差
Is Position Bias in Dense Retrievers Built In–or Learned from Data?
通过 32 组严格控制变量实验证明:密集检索器的位置偏差主要来自训练数据,而非模型结构天生决定;均匀分布答案位置可将偏差降低 57%~87%。
论文综述:UniSteer
UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering
训练一个通用流场模型,用自然语言描述即可动态控制大语言模型的行为风格,无需为每种行为单独训练,一个模型解决所有任务。
论文综述:Xetrieval
Xetrieval: Mechanistically Explaining Dense Retrieval
为密集检索加上解题过程:通过推理内化器注入三角度思考,再用稀疏自动编码器解码为人类可读特征,经因果验证证明解释真实有效。