来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-09-24 批次;已剔除近几日已推荐的 10 篇同批次论文)
今日精选
1. SAGE:用拓扑引导缓解长程推理偏差
- 原标题: SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance
- 作者/机构: Xinyue Zeng 等(University of Wisconsin-Madison、Dartmouth College)| arXiv
- 核心贡献: ① 解释稀疏奖励下 LLM 长程推理脆弱性的两个来源——探索偏差(被局部合理但结构不稳定的分支吸引)与复合偏差(局部微小偏差沿深度累积、压制稀有奖励);② 提出 SAGE 框架,用代数稀疏化抑制虚假分支、用双曲空间嵌入提供逐深度密集信号;③ 覆盖 12 个基准、7 个模型家族全面超越基线,在开放式长程任务 Andrews-Curtis 问题上最高提升 8 倍。NeurIPS 2026 接收,代码开源。
- 工程关联: 对 Agent 的多步规划与稀疏奖励 RL 训练直接可用——为推理链注入结构先验(子空间投影 + 双曲深度信号)是可复用的设计模式。
- 价值点: 提供了一个理论驱动的「结构引导」通用框架,长程 Agent 任务(规划、证明、搜索)性能瓶颈时可优先尝试。
2. RAPID:从单次人类演示自动生成可验证的机器人程序
- 原标题: RAPID: Robot Agentic Programming from Demonstrations
- 作者/机构: Yuyao Liu, Jiayuan Mao 等(MIT、NUS、UPenn、NVIDIA)| arXiv
- 核心贡献: ① 把编码 Agent 的「生成-验证-迭代修复」循环引入机器人编程:仅凭一段视觉演示,自动推断可测试的任务规约、动作原语和交互验证环境;② 采用对象中心的关系式程序表示,把动作原语表达为轨迹优化程序、用关系约束捕获运行时场景几何,使程序可跨物体姿态/形状/材质泛化;③ 在 8 个接触丰富的非抓取操作任务与 LIBERO-Pro 上表现强劲,并已部署到真实 Franka 机械臂。
- 工程关联: 是 Coding Agent 范式向具身领域迁移的范本——「演示 → 可执行可验证程序」的 agentic loop 设计对自动化工作流生成同样有参考价值。
- 价值点: 展示了如何用 LLM Agent 自动完成「规格推断 + 代码生成 + 环境内验证」的完整闭环,思路可平移到非机器人领域的自动化任务。
3. TRACE:从策略梯度反演出具身 RL 智能体的完整隐私轨迹
- 原标题: Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
- 作者/机构: Sudip Bhujel 等(University of Kentucky、WUSTL)| arXiv
- 核心贡献: ① 揭示分布式具身 RL「只传梯度不上传原始数据」的隐私假设不成立:提出 TRACE 攻击,从逐步策略梯度自回归重建完整观测-动作轨迹序列;② 利用两个此前被忽略的结构信号——相邻梯度间的跨时间相关性(条件互信息界刻画)与策略头梯度结构中的闭式动作恢复;③ 重建质量达 18.8 dB PSNR、动作近乎完美恢复,每帧仅 3-4.5 ms,比优化式攻击快数个量级,且跨多种受害架构通用。NeurIPS 2026 接收。
- 工程关联: 对联邦学习/分布式训练 RL 系统是重要的安全警示:梯度不是匿名化手段,序列级梯度尤其危险。
- 价值点: 提示需要序列感知的隐私防御(如梯度加噪、差分隐私)——部署分布式智能体前应评估梯度泄露面。
4. 把音频描述建模为约束全局优化:LLM 提案 + MILP 调度
- 原标题: What, When, and How: Audio Description as Constrained Global Optimization
- 作者/机构: Igor Sterner 等(University of Edinburgh)| arXiv
- 核心贡献: ① 指出现有自动影视音频描述(AD)系统把任务当局部 video-to-text 生成,忽略了「描述什么、何时插入、如何压缩表达」三个耦合决策;② 形式化为约束优化问题:LLM 负责提案视觉要素、估计叙事显著性、生成压缩表述,混合整数线性规划(MILP)在时间约束下跨场景联合选择与调度描述;③ 在 REFRAMED 基准上建立叙事 QA 与时间定位指标的新 SOTA,消融证实时间约束驱动放置质量、显著性估计控制内容保留量。
- 工程关联: 「LLM 生成候选 + 求解器做全局调度」的混合架构可迁移到任何带硬时间窗约束的生成任务(字幕、广告插入、直播解说)。
- 价值点: 提供了让 LLM 输出满足严格时间/资源约束的实用工程路径,比纯提示工程可控得多。
5. 潜空间神经代理求解器的长程稳定性训练法
- 原标题: Beyond Compression: Training Latent Representations for Stable Long-Horizon Rollout in Neural Surrogate Solvers
- 作者/机构: Andreas E. Robertson 等(Sandia 国家实验室,依作者团队与 SNL 缩写推断,页面未直接标注)| arXiv
- 核心贡献: ① 定位潜空间代理模型长程自回归 rollout 误差爆炸的根源:仅为重建而训练的潜表征不适合长时程预测;② 系统评估训练级干预——Koopman 算子学习、Hamming 噪声注入、多步 rollout 微调;③ 长程误差降低约 40%,以少 2 个数量级的 FLOPs 和一半显存达到或超过全分辨率模型精度,并在高周疲劳晶体塑性仿真上实现远超训练时程的稳定外推。
- 工程关联: 揭示了一个反直觉规律:改善长程稳定性的干预常常会降低重建/单步预测等常规指标——对训练时序模型(含世界模型)选择验证指标有直接指导意义。
- 价值点: 做长时程 rollout 类模型(仿真代理、世界模型)时,应围绕 rollout 稳定性设计表征训练与评估,而非只看一步预测精度。
今日关键词
长程推理(Long-Horizon Reasoning)· 结构引导探索(Structural Guidance)· 演示学习(Learning from Demonstrations)· 梯度反演攻击(Gradient Inversion Attack)· 具身强化学习隐私(Embodied RL Privacy)· 约束优化(Constrained Optimization)· 神经代理求解器(Neural Surrogate Solver)