来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-09-29,较执行日滞后 2 天,属正常延迟)· 已核对近 5 天日报,无重复推荐

今日精选

1. 先思考「怎么思考」:通过元推理扩展 Agentic 推理

  • 原标题: Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
  • 作者/机构: Paras Dahal 等(Meta Superintelligence Labs)| arXiv
  • 核心贡献: ① 解决长程 Agent 任务中「运行控制」本身成为负担的问题 ② 提出 agentic meta-reasoning 推理时框架:Worker 执行任务计算,Controller 汇总当前进展、探索下一步选项、在剩余预算下评估各选项价值并派发工作,Controller 仅携带运行的紧凑摘要而非完整历史,持久记忆提供上下文 ③ 在 ProgramBench 上达到 71.5%,显著优于同 Worker、同算力预算的直接控制 Agent 及生产级 coding agent 基线
  • 工程关联: 直接面向 Agent 编排工程——把「继续/重启/停止」这类控制决策从隐式提示变成显式结构化推理,可迁移到多步任务调度、预算控制等 Agent 框架设计
  • 价值点: 给出了控制开销与任务计算的解耦范式:Controller 只维护紧凑运行账本,是长任务 Agent 降低上下文膨胀的实用模板

2. SelfSearch:无奖励信号的自改进 Agent 搜索

  • 原标题: SelfSearch: Reward-Free Search for Self-Improving Agents
  • 作者/机构: Jungwoo Yang 等(首尔国立大学 Seoul National University)| arXiv
  • 核心贡献: ① 现有 Agent 自改进依赖反复的下游评测打分,成本高且绑定特定任务 ② 提出 reward-free 搜索:Agent 依据过往自改实验记录(含推理、工具动作、结果)修改自身指令/工具/执行流程,搜索期不需要奖励信号 ③ 六个模型×基准设置中全部超越初始 Agent,Terminal-Bench 2.1 单体最高 +11.2pp;SWE-bench Multilingual +5.0pp 且执行成本降 38.5%;搜索成本仅 $4.03
  • 工程关联: 为 Agent 自动调优提供低成本路径——用「自改经验库」替代昂贵的评测循环,适合没有可靠自动评分器的生产场景
  • 价值点: 证明了经验记录本身可作为改进信号,把 Agent 自演化的搜索成本压到几美元量级

3. WUSH-KV:数据自适应变换的低比特 KV Cache 量化

  • 原标题: WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms
  • 作者/机构: Jiale Chen 等(IST 奥地利科学技术研究所 · Red Hat AI · ETH Zürich)| arXiv
  • 核心贡献: ① KV Cache 显存/带宽随上下文长度与 batch 增长,限制长上下文推理 ② 从矩阵乘两因子二阶统计构造数据感知正交变换 WUSH,key 变换置于 RoPE 之后、value 变换折叠进模型权重,可配截断量化器;理论上证明对 QuEST INT 量化器近最优 ③ 逐层重建误差最低、端到端困惑度优于现有变换;集成进 SGLang 后 2-bit 下性能持平或超过 OSCAR
  • 工程关联: 长上下文推理部署的核心优化——即插即用的 KV 量化方案,已有 SGLang 集成路径,2-bit 下几乎无损
  • 价值点: 为长上下文/大 batch 推理提供了带理论保证的 KV Cache 压缩方案,直接降低显存与带宽成本

4. RICE:仅靠 In-Context 示例构建稠密检索器

  • 原标题: Effective Dense Retrieval using Only In-Context Examples
  • 作者/机构: Nour Jedidi 等(滑铁卢大学 University of Waterloo · 昆士兰大学 The University of Queensland)| arXiv
  • 核心贡献: ① decoder-only LLM 通常需训练才能成为强稠密检索器 ② 提出 RICE:零训练方法,通过在 prompt 中给少量共享上下文示例条件化 LLM,即可产出高质量 query/document 稠密表示 ③ 显著提升基于 prompt 的 LLM embedding 检索精度,代码开源(github.com/nourj98/RICE)
  • 工程关联: RAG 工程直接受益——无需微调即可把现成 LLM 变成可用的稠密检索器,适合快速搭建或冷启动检索管线
  • 价值点: 「training-free 建检索器」大幅降低 RAG 系统的构建门槛,代码可直接复用

5. 答案对了,推理链却错了:可验证小学数学揭示 CoT 轨迹的真相

  • 原标题: Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces
  • 作者/机构: Ratish Puduppully 等(哥本哈根 IT 大学 · 金奈数学研究所 · IIT Jammu · 亚利桑那州立大学)| arXiv
  • 核心贡献: ① CoT 轨迹常被当作模型真实推理记录用于调试与审计,但自然语言轨迹难以机械验证 ② 在可逐步程序化验证的 iGSM 基准上检验:分布内答案正确性与轨迹有效性几乎重合,分布外急剧解耦——最难实例上 31.6% 的正确答案伴随无效轨迹,其中过半指向正确答案 ③ 说明「答案对」不能作为「推理对」的证据
  • 工程关联: 对依赖 CoT 做 Agent 审计、调试、过程奖励(PRM)的团队是直接警示——轨迹验证需要任务级可验证信号,不能只看最终答案
  • 价值点: 提供了量化证据:以 CoT 可信度为前提的监控/审计方案在分布外会系统性失效,工程上应配套轨迹级校验

今日关键词

Agentic 元推理 (Meta-Reasoning) · 自改进 Agent (Self-Improving Agents) · KV Cache 量化 (KV Cache Quantization) · 免训练稠密检索 (Training-Free Dense Retrieval) · RAG · 思维链忠实性 (CoT Faithfulness) · 长上下文推理 (Long-Context Inference)