来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-08-03,较执行日期延迟 2 天)
今日精选
1. Qwen-CUA:原生「计算机使用」智能体——只看截图、只按键盘鼠标
- 原标题: Qwen-CUA: Native Computer Use for (almost) Everything
- 作者/机构: 通义千问团队 & Xlang Lab(阿里巴巴)| arXiv
- 核心贡献: ① 目标是让智能体像人一样操作任意软件:只用截图作为观察、键盘鼠标事件作为动作,不依赖 DOM 树、无障碍元数据或任务专用 API。② 基于 397B-A17B 的 Qwen MoE 骨干;scaffold 维护最多 20 张活动截图,更早的视觉历史按固定大小块折叠保留;训练动用近 10 万 vCPU 的云端 rollout 集群、约 4 万个可验证任务,用可验证奖励 + 轨迹切片优化完整轨迹,并迭代刷新 SFT 数据与 RL 任务分布。③ 在 8 个计算机使用基准上全面超越 Qwen3.7、对标头部闭源系统:OSWorld-Verified 达 86.2(万亿参数版 Qwen-CUA-Max 提至 87.6);RedTeamCUA 攻击成功率从 36.6 降至 16.4。
- 工程关联: 展示了「纯视觉 + 键盘鼠标」通用智能体界面的完整训练配方(可验证奖励、长程轨迹切片、迭代数据刷新),对 GUI Agent / 计算机使用 Agent 研发有直接参考价值。
- 价值点: 证明原生计算机使用可成为通用 Agent 基座,且开源(github.com/xlang-ai/Qwen-CUA),是继文本/代码后最接近「什么都能做」的交互范式。
2. AURORA-LM:连续潜空间扩散语言模型——不为扩散简化表征,让扩散去学高容量潜变量
- 原标题: AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
- 作者/机构: Jiajun Liang, Yucheng Liao, Yukang Cao 等(南京大学 PRLab · 南洋理工大学 S-Lab · 帝国理工学院)| arXiv
- 核心贡献: ① 图像/视频/音频已在连续潜空间建模,文本仍依赖离散 token。现有连续语言模型要么沿用非生成设计的嵌入空间,要么压缩潜变量降低扩散难度、牺牲 token 级保真。② AURORA-LM 反其道而行:保留高容量、可解码的文本潜表示,用 Query-based Encoder-Decoder 组织前缀对齐的潜序列,再用 Block-causal Diffusion Transformer 以 flow matching 学习其分布(逐块自左向右生成、块内并行去噪);仅限制噪声输入通路、保留完整干净潜预测目标,并按潜宽校准噪声分布、引入自轨迹一致性。③ 在 OpenWebText 自由生成与 XSum 摘要上取得连续/扩散式语言模型最强性能;1B 参数(约 1500 EFLOPs)即超越更大的开源潜扩散语言模型;全部实验在昇腾 NPU 上完成。
- 工程关联: 对「扩散式 LLM」这一下一代文本生成范式给出可复现实现,关注点包括连续潜表示设计、flow matching 训练与推理去噪的一致性——与现有自回归管线差异大但潜力明确。
- 价值点: 首次让「不压缩的全文保真文本潜变量 + 扩散生成」跑通并取得 SOTA,为绕开离散 token 的生成建模提供了新路线。
3. LiveMem:长程 LLM 推理的内存状态连续性——证据被移出上下文也能作答
- 原标题: LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference
- 作者/机构: Zhichen Liu, Ruihan Sun, Hengjie Yang 等(NatureSelect.AI · 南方科技大学 · 西安电子科技大学)| arXiv
- 核心贡献: ① 指出现有上下文保留/摘要/检索方案都只保留「选中的历史」,缺少跨完整生命周期的持久状态;将缺失能力形式化为「上下文更替下的状态连续性」——用与活动上下文生命周期无关的固定容量内存状态承载计算。② LiveMem 在预训练全注意力 LLM 上附加内存状态,主注意力路径只保留有界 KV 窗口;上下文更替与内存状态维护、面向记忆的后训练、状态感知的 serving 三者配合,使内存状态在源 token 释放后仍可承载信息。③ 在 LongMemEval 上总体性能领先同类系统,且当支撑证据已从当前上下文移除时仍能凭内存状态正确作答;证据距离分析显示有用信息在活动窗口之外持续存在。
- 工程关联: 为「超长会话 / 常驻助手」提供超越 KV 缓存与 RAG 的第三类方案——固定容量内在记忆 + 有界窗口,直接关系长程 Agent 的成本与连续性设计。
- 价值点: 把「状态连续性」确立为持续推理中独立且互补的抽象,长会话场景下有望显著降低无限增长的上下文开销。
4. RoMeRL:自演化 Agent 记忆的降阶强化学习——记忆更小、反馈更密、奖励污染更少
- 原标题: RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
- 作者/机构: Yi Yang, Zhennan Chen, Yihong Zhuang 等(南京大学 · 厦门大学 · 浙江大学)| arXiv
- 核心贡献: ① 学习式 Agent 记忆系统有两个耦合难题:轨迹索引效用随交互历史膨胀,稀释有限反馈;轨迹级奖励被共同检索的记忆共享,无关经验收到误导性效用更新而陷入「记忆-奖励陷阱」。② 提出降阶记忆强化学习(RoMeRL):用按结果极性 + 记忆动态分解的固定维逐任务记忆状态表示不断增长的效用空间,新经验通过固定语义坐标集更新/替换,把反馈集中在有界效用支撑上;理论上证明了降阶参数化提升每个效用坐标的平均反馈,并刻画错误坐标的稳态占用。③ 在 ALFWorld 与 LifelongAgentBench 上:Cold-Q 比值降低 80.0%、反馈密度提高约 6.0 倍、记忆体量缩减 84.4%、LLM 调用减少 21.1%,同时任务性能提升。代码开源(github.com/YOUNG-fnxm/RoMeRL)。
- 工程关联: 直接解决 Agent 长程记忆系统的「越用越乱」问题——降阶效用状态在压缩记忆存储的同时提升反馈效率,适合需要持续自演化的记忆层设计。
- 价值点: 首次系统刻画并缓解「记忆-奖励陷阱」,用理论 + 大幅度的工程指标(-84% 记忆、-21% LLM 调用)证明降阶记忆强化学习的可行性。
5. SWE-Touch:用户「动手改代码」时编码智能体还扛得住吗?
- 原标题: SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
- 作者/机构: Yuqiao Tan, Jinxiang Meng, Fangyu Lei 等(中科院自动化研究所 · 中国科学院大学)| arXiv
- 核心贡献: ① 真实开发中用户在任务进行时可能查看/修改代码,而现有仓库级基准只评测「独自工作」的 Agent 或仅允许消息交互。SWE-Touch 用「对抗性编辑(Counter-Edits)」压测该场景:从多条修复轨迹挖掘任务关键区域,用独立的用户补丁生成器构造与任务完成相冲突的合理编辑,并在 Agent 到达相关代码时连同情境化用户消息注入。② 在 SWE-bench Verified 上评测 9 个编码模型,另加 SWE-Bench Pro 与 DeepSWE 的长程任务。③ Counter-Edit 使平均解决率下降 7.7 个百分点,长程基准同样退化;轨迹分析显示失败源于对演化工作区的感知不足——Agent 可能保留冲突代码,或替换后未重新检查仓库、未用定向测试验证修改。代码开源(github.com/Trae1ounG/SWE-Touch)。
- 工程关联: 为「人机协写代码」场景提供首个压力评测框架,明确指出工作区变化检测、冲突编辑调和、受影响行为验证是编码 Agent 下一步优化关键。
- 价值点: 提醒工程团队:自主能力强的编码 Agent 不等于协作可靠——共享工作区感知是落地人机结对编程前必须补齐的能力。
今日关键词
计算机使用智能体 · Computer-Use Agent · 连续潜空间语言模型 · Continuous-Latent Diffusion LM · 内存状态连续性 · Memory State Continuity · 自演化记忆 · Self-Evolving Agent Memory · 降阶效用状态 · Reduced-Order Utility States · 编码智能体评测 · Coding Agent Benchmark · 对抗性编辑 · Counter-Edits · 强化学习 · Reinforcement Learning