来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-31,较执行日期延迟 4 天)
今日精选
1. SESA:自博弈驱动的自演化技能搜索智能体(会出题、会解题、会记忆)
- 原标题: Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember
- 作者/机构: Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai 等(中国科学院大学/中科院自动化所 · 北京大学 · 清华大学 · 明略科技)| arXiv
- 核心贡献: ① 指出自博弈智能体生成的训练问题缺乏持久状态——失败只影响梯度,不会显式塑造后续练习;外部技能记忆则通常从固定任务分布中学习。提出 SESA:让程序性记忆成为「工具增强搜索自博弈」的演化状态。② 挑战者(challenger)负责出题,独立参数化的解题者(solver)专门检索技能;信息性失败被蒸馏成可复用技能写回记忆,更新后的记忆改变解题者行为与成功率,进而改变挑战者奖励和未来问题分布,形成「出题—解题—记忆」双向共演化闭环;技能收益可进入模型参数,支持无记忆部署与可选的推理时检索。③ 在 7 个开放域/多跳问答基准上,SESA 较 SSP 平均准确率提升 1.2–3.2 点(多个骨干模型),统一评测下超越技能增强基线 SkillRL 0.9 点;Qwen3 上 SESA-Off 保留 1.8–2.2 点提升,最终技能库再贡献 0.5–1.0 点。代码开源。
- 工程关联: 对 Agent 训练范式(自博弈/课程学习)和「记忆 + 策略」架构设计有直接参考——技能记忆不仅做推理时插件,还能改变策略学习与未来训练分布。
- 价值点: 提供了任务生成与技能记忆共演化的可复现实现(含开源代码),让 Agent 的训练数据与程序性经验能持续自我改进。
2. Zero-Mem:LLM Agent 的零 Token 记忆操作
- 原标题: Zero-Mem: Zero-Token Memory Operations for LLM Agents
- 作者/机构: Yilin Xiao, Zhehan Zhu, Yujing Zhang, Jin Chen 等(香港理工大学 · 西南财经大学 · 吉林大学)| arXiv
- 核心贡献: ① 质疑「结构化记忆访问必须依赖生成」的默认假设——现有 Agent 记忆系统通过额外 LLM 调用来写入中间记录和中介检索,带来持续的 token 与时间开销,且省略/合并细节会掩盖原始证据。② 提出 Zero-Mem:除最终问答外,记忆操作不调用 LLM、不消耗输入/输出 token。以原始交互轨迹为记录来源,用「实体—上下文图」暴露跨交互连接 + 「时间层级」保留对话局部性与会话状态双重视图组织;查询时加权两种视图检索,确定性校准先丢弃冲突证据,再让阅读器基于检索轨迹作答。③ 在长记忆与长上下文问答基准上性能与基线持平,同时消除记忆操作的 LLM 调用与 token 消耗;相同最终问答阅读器与上下文预算下,记忆操作时间成本较最快基线降低 57.6%。
- 工程关联: 对 Agent 记忆系统的成本优化(token/延迟双降)和「免 LLM 记忆层」架构有直接借鉴价值,尤其适合长会话与成本敏感场景。
- 价值点: 证明「结构化 Agent 记忆不需要生成中间表示」——把记忆操作从 LLM 调用中剥离,可大幅削减 Agent 长程交互的推理成本。
3. TwT:面向多领域机器翻译的难度自适应推理(已收录 ACL 2026)
- 原标题: Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation
- 作者/机构: Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi(厦门大学 · 中国人民大学,机构为推断)| arXiv
- 核心贡献: ① 多领域机器翻译(MDMT)各领域语言复杂度差异大,现有推理式翻译对所有输入无差别长思考,导致过度思考与 token 浪费。受人类「按难度调节推理投入」启发,提出 TwT:在直觉推理(System 1)与深思推理(System 2)之间自适应切换。② 两阶段训练:先用 DeepSeek-R1 蒸馏的难度感知长思维链经 GPT-4o 重写为类人「推理经济」轨迹做 SFT,再用混合奖励的强化学习同时优化翻译质量与推理效率。③ 在 15 个基准(含域内/域外、3 种已见 + 59 种未见语言)、3 个骨干模型的消融下,TwT-7B/14B 在翻译质量上超越更大的 SOTA 推理模型,同时 token 使用减少 32–60%。
- 工程关联: 对推理模型的「按需思考」效率优化有直接示范——把认知原则对齐进 RL 奖励设计,可同时提升质量与吞吐。
- 价值点: 提供了一套「难度感知 + 推理经济」的可复现 RL 训练配方,翻译类应用可直接迁移以显著降低推理成本。
4. AgentHPOBench:评估 LLM Agent 作为序列化超参数优化器的基准
- 原标题: AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
- 作者/机构: Tianyu Huai, Tingshuo Fan, Xinchi Chen 等(复旦大学 · 上海创智学院 · 华东师范大学 · OpenMOSS)| arXiv
- 核心贡献: ① 现有基准多聚焦静态代码生成、论文复现或最终答案正确性,无法直接检验 Agent 能否「解读实验证据并指导后续超参决策」。提出 AgentHPOBench:30 个可执行 ML 任务、7 个研究类别,每个任务从验证过的基线运行开始,Agent 进行多次序列化干预,每步观察累计配置、指标与日志后提出下一合法配置。② 统一协议下评测 12 种主流 Agent 与常规 HPO 基线。③ 结果显示当前 Agent 确实展现出跨领域的实验优化能力,但在持续迭代精修、复杂日志诊断、以及向参考性能稳定推进方面仍存在明显局限。
- 工程关联: 为「Agent 驱动 AutoML / 科学实验自动化」提供首个序列化评测基准,可直接用于衡量自研 Agent 的实证决策能力。
- 价值点: 明确指出了现役 Agent 在实验优化上的能力边界(迭代精修与日志诊断),为 Agent 评测与训练提供新靶点。
5. HyPE:把假设生成移到索引阶段——面向 RAG 的假设性提示嵌入
- 原标题: Bridging the Question-Answer Gap in Retrieval-Augmented Generation: Hypothetical Prompt Embeddings
- 作者/机构: Domen Vake, Jernej Vičič, Aleksandar Tošić(斯洛文尼亚普里莫尔斯卡大学 / InnoRenew CoE)| arXiv
- 核心贡献: ① RAG 中用户查询与文档文本存在风格鸿沟,HyDE 等运行时方案需在查询时额外生成假设文档,增加计算开销。提出 HyPE:把假设内容生成从查询时搬到索引阶段——为每个数据块预计算多个假设提示,用提示的嵌入替代块本身,将检索转化为「问—问匹配」。② 不引入查询延迟,同时强化查询与相关上下文的对齐;与重排序、多向量检索、查询分解等 RAG 增强技术兼容。③ 在 6 个常见数据集上,较标准方法检索上下文精确率最高提升 42 个百分点、claim 召回率最高提升 45 个百分点(已发表于 IEEE Access)。
- 工程关联: 对 RAG 检索质量优化极具实操价值——将 LLM 开销从查询路径移出,索引一次、查询零延迟,适合对延迟敏感的生产检索系统。
- 价值点: 用「离线预计算假设提示」巧妙规避 HyDE 的在线开销,用近乎零成本换得检索精度的显著提升。
今日关键词
自博弈 · Self-Play · 技能记忆 · Skill Memory · 零Token记忆操作 · Zero-Token Memory · 难度自适应推理 · Difficulty-Adaptive Reasoning · 强化学习 · Reinforcement Learning · 超参数优化 · Hyperparameter Optimization · 假设性提示嵌入 · Hypothetical Prompt Embeddings · 检索增强生成 · RAG