来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-10-01,执行日期 10-04,批次冻结重复期已做跨 5 天去重,与前几日零重复)
今日精选
1. VISTA:让多模态模型在交互世界中「看得住长程」的视觉脚手架
- 原标题: VISTA: A Visual Harness for Reasoning in an Interactive World
- 作者/机构: Qiushi Han 等(MIT,Kaiming He 组)| arXiv
- 核心贡献: ① 解决多模态模型在长程交互任务(如 ARC-AGI-3)中视觉记忆丢失、无法回看早期观察的问题 ② 提出一个通用视觉 harness:模型直接以视觉观察感知环境,维护「无损视觉记忆」保存全部历史帧,并可在推理中主动检索与重组视觉输入 ③ 在 ARC-AGI-3 上将 Claude Opus 5.0 的 Relative Human Action Efficiency 从 40.68 提升到满分 100.00,完成全部 25 个公开游戏且动作数比首次游玩的人类少 57.4%
- 工程关联: 对 Agent 开发方向参考极强——证明「harness 而非模型」是 eliciting 既有能力的关键;无损外部记忆 + 按需检索的思路可直接迁移到 GUI Agent / 计算机使用类应用的状态管理
- 价值点: 一句话:给 Agent 加一个「可回看、可缩放」的原始观察存储,比换更强的模型更能提升长程任务成功率
2. Mem++:面向长期组织型 LLM Agent 的非破坏性记忆
- 原标题: Mem++: Non-Destructive Memory for Long-Term Organizational LLM Agents
- 作者/机构: Ahmad Yehia 等(UT Austin · AIDAChip Inc.)| arXiv
- 核心贡献: ① 指出主流 Agent 记忆系统在写入时即压缩文档(蒸馏为事实/笔记/图边),导致「未提问就固定了能回答什么」,无法处理「某时点的有效决策是哪一版」这类时态问题 ② 提出 write-time 零生成调用的非破坏性记忆:整篇文档连同日期与作者原样存储,读时按问题时间点过滤文档再做词法+语义融合排序 ③ 支持时间点问答与版本追踪,旧版本不被覆写
- 工程关联: 直接对应企业 RAG / Agent 记忆系统的架构选型:write-time 压缩 vs read-time 检索的权衡,对需要审计、版本管理的组织知识库尤其关键
- 价值点: 一句话:与其在写入时冒险压缩,不如存原文、把智能放到读取时的时态过滤上
3. CARM:LLM 强化学习中的抵消感知响应掩码
- 原标题: CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning
- 作者/机构: Yafei Zhang 等(摩尔线程 Moore Threads AI)| arXiv
- 核心贡献: ① 解决 RL 后训练中 rollout 与训练引擎不一致导致的 off-policy 响应处理问题:常用的长度归一化几何平均掩码中,正负 log-ratio 会跨位置相互抵消,掩盖真实的双向策略漂移 ② 提出先取每个 token log-ratio 的绝对值再平均的序列级掩码,并给出接受响应的联合界证明 ③ AIME 2024/2025/2026 + BeyondAIME 的 mean@16 最高提升 3.13 个百分点,四个代码基准平均 pass@1 提升 2.88 点
- 工程关联: 对自建 RL 训练管线(尤其 rollout/训练引擎异构,如 vLLM + 训练框架分离)的团队是即插即用的修正项,一行掩码改动即可对齐训练信号
- 价值点: 一句话:几何平均掩码会「正负抵消」假阳性通过,取绝对值平均是更可靠的 off-policy 过滤器
4. Mingbird:让 2-9B 小模型在本地完成真实任务的 Agent Harness
- 原标题: Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks
- 作者/机构: Hao Wang, Ting Huang(北京科技大学 · Honor Device 荣耀)| arXiv · 代码
- 核心贡献: ① 系统化证明小模型在云端规模 harness 下完不成任务,相当一部分失败归因于 harness 而非模型(工具 prefill 撑爆上下文、自我修正发散、工具演示循环、任务静默放弃)② 设计 10 项针对性机制,代表项包括字节级零净增 prefill 预算、完成前重读任务的 finish gate、签名级循环检测 ③ 自建 LRAB 基准上得 0.886(对比 goose 0.631 / opencode 0.479),τ²-bench 上 0.856,全部 288 个格子结果公开
- 工程关联: 端侧 / 本地小模型 Agent 落地的直接参考:上下文预算管理、防循环、完成校验三类机制可移植到任何 harness
- 价值点: 一句话:小模型跑 Agent 的瓶颈常在脚手架,论文给出了一份可复现的机制清单与全部实验数据
5. 旧想法、新问题:LLM 新颖性评测的不稳定性
- 原标题: Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation
- 作者/机构: Noy Sternlicht 等(希伯来大学 · Allen Institute for AI · Microsoft · University of Arizona · UW)| arXiv
- 核心贡献: ① 针对「用 LLM 评审科研想法新颖性」这一日益普遍的做法做系统受控研究:从 OpenReview 挖掘审稿人明确肯定/否定原创性的段落构建评测集 ② 发现微小的 prompt 措辞变化可翻转过半的评审结论——同组 idea 对的 pairwise accuracy 可移动超 50 点甚至低于随机 ③ 检索增强与更大推理预算帮助甚微,两个专建的新颖性评估器反而不如最便宜的 prompt 基线
- 工程关联: 对所有「LLM-as-judge」管线(自动评测、数据筛选、A/B 裁决)都是警示:judge 的措辞敏感性必须纳入评测设计,否则自动化 ideation 系统报告的新颖性增益存疑
- 价值点: 一句话:把裁判交给 LLM 前,先用极端正反例校准它的措辞鲁棒性,否则结论可能是噪声
今日关键词
Agent Harness · 视觉长程记忆 (Visual Memory) · 非破坏性记忆 (Non-Destructive Memory) · Off-Policy 掩码 (Response Masking) · 小模型本地推理 (Local-First) · LLM-as-Judge 稳定性 · 强化学习后训练 (RL Post-Training) · 时态知识问答 (Point-in-Time QA)