来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-09-28,比执行日期滞后 2 天,属正常批次延迟;已比对近 5 天日报,零重复)
今日精选
1. Harness 学习:让智能体的”脚手架”自己进化
- 原标题: Harness Learning Enables Generalizable Test-Time Adaptation
- 作者/机构: Alvin Zhang、Xuecheng Liu、Ruslan Salakhutdinov、Daniel Khashabi、Yuda Song、Andrea Zanette 等(CMU · JHU · 斯坦福大学)| arXiv
- 核心贡献: ① 解决智能体固定 harness(组织模型调用/工具使用/信息流的执行程序)无法适配新任务的问题 ② 提出 harness learning:训练一个 proposer 模型根据执行反馈修改 solver 的 harness,形式化为”对可执行程序做元学习”——harness 修改类比梯度更新,用 RL 以修改后 harness 的任务表现为奖励训练 ③ 测试时无需任何参数更新,仅靠反馈迭代修改 harness 即可迁移到未见任务;推理与多跳问答实验显示修改质量与跨任务泛化均有提升
- 工程关联: Agent 工程的核心抽象——把”模型”与”编排代码”分离后,编排层本身可以成为可学习对象;对 agent 框架的自动调优/self-improving 管线有直接参考
- 价值点: 不动权重、只改 harness 的测试时适应路径,为”持续学习智能体”提供了比微调便宜得多的工程实现方案
2. KV-streams:智能体 RL 训练中上下文压缩不再反复 prefill
- 原标题: KV-streams for Efficient Compaction in Agentic Reinforcement Learning
- 作者/机构: Emiliano Penaloza、Siddarth Venkatraman、Alessandro Sordoni、Marc-Alexandre Côté、Guillaume Lajoie 等(Mila · 麦吉尔大学 · 微软研究院 · ServiceNow · 爱丁堡大学等)| arXiv
- 核心贡献: ① 解决智能体 RL 训练中长轨迹塞爆 GPU 显存、而现有上下文压缩需反复 prefill 导致吞吐低下的瓶颈 ② 提出 KV-streams:压缩时把 KV cache 向前流式传递而非清空重来,即插即用兼容任意压缩策略 ③ 三种压缩策略下训练取得 2.6-5× 墙钟加速且无损性能;还发现流式 KV cache 可充当循环状态,记住早已离开上下文的信息,且仅需 RL 即可涌现该行为
- 工程关联: 模型部署与 agent 后训练的基础设施方向——任何做长 horizon agent RL(多轮工具调用轨迹)的团队都会撞上这个显存/吞吐墙
- 价值点: 一个即插即用的训练加速组件,2.6-5× 训练提速直接压低长任务 agent 后训练成本
3. 连续潜在扩散做推理:不用自回归也能一步步”去噪”出答案
- 原标题: Reasoning with Continuous Latent Diffusion
- 作者/机构: Xiang Cheng(杜克大学 Duke University)| arXiv
- 核心贡献: ① 探索自回归之外的新推理范式:连续扩散在潜在空间迭代精化、一步生成完整推理解 ② 提出 LFRM(Latent Flow Reasoning Models):从强自回归教师的多层表示学习紧凑表征,支持不同速率的异步去噪,并用阶段式课程训练紧凑 prompt 编码器以在推理时完全替换教师 Transformer ③ 仅 638M 去噪骨干:GSM8K 63.74% pass@1、MATH500 24.6%(64 步),HumanEval 32.85%(128 步),超过同规模连续扩散基线
- 工程关联: 推理架构多样化方向——扩散式推理若成熟,可绕开自回归逐 token 解码的延迟上限,对推理部署的并行化有想象空间
- 价值点: 单作者作品却给出了目前最强的连续扩散推理数字之一,附代码,适合关注非自回归推理路线的团队跟踪
4. AI Night-Scientist:用 RL 教 LLM 跳出低熵、敢想”离谱”的科研点子
- 原标题: Reinforcing Agentic Creativity in Scientific Ideation with Night Science
- 作者/机构: Priyanka Kargupta、Silviu Cucerzan、Jiawei Han、Ryen W. White 等(微软 · 伊利诺伊大学 UIUC)| arXiv · 代码
- 核心贡献: ① 解决 LLM 低熵偏置导致的输出同质化,限制其在开放式科学构思中的价值 ② 提出 AI Night-Scientist 智能体框架:以认知科学为基础,用强化学习教模型”何时以及如何偏离”可预测的推理路径,在结构化的”日科学”与发散的”夜科学”之间灵活切换 ③ 实验表明创造性是可学习的多层次能力,经训练后模型能产出超越常规探索范围的科研想法
- 工程关联: Agent + 科研构思(AI co-scientist)方向:RL 奖励不必只对齐”正确性”,也可以对齐”有用的新颖性”
- 价值点: 微软开源的智能体框架,提供了把”创造性”纳入 RL 训练目标的可复用范式,对需要头脑风暴类能力的 agent 产品有直接借鉴意义
5. Foil:循环 MoE 的正确打开方式——摊平专家、解开注意力
- 原标题: How to Loop MoE: Flatten the Experts, Untie the Attention
- 作者/机构: Shouren Wang、Chuang Ma、Mohsen Hariri、Vipin Chaudhary 等(凯斯西储大学 Case Western Reserve University · 京都大学 · NII LLMC)| arXiv · 代码
- 核心贡献: ① 回答”稀疏 MoE 如何做循环复用(looping)“这一架构设计问题:固定专家参数量与每 token 专家计算量,Foil 将专家层减半、每层专家数与循环次数加倍(摊平),并给每次循环配独立注意力参数(解绑)② 100B token 预训练下损失随摊平程度单调下降,最优配置比同参数同算力的未摊平基线低 0.012 nat,下游精度持平或更好 ③ 消融给出可操作设计准则:循环收益与专家层加宽相互放大,路由置信度比负载均衡更能反映专家健康度
- 工程关联: 模型架构与训练效率方向——对小团队用固定算力榨干参数预算(参数复用 × 稀疏专家)有直接指导意义
- 价值点: 给出了一份带代码的 looped-MoE 设计指南:想让小模型”多想几步”,应增加每层专家数与循环次数、并解绑注意力
今日关键词
Harness 学习(harness learning)· KV 缓存压缩(KV cache compaction)· 智能体强化学习(agentic RL)· 潜在扩散推理(latent diffusion reasoning)· 测试时适应(test-time adaptation)· 循环 MoE(looped MoE)· 创造性 RL(agentic creativity)