来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-08-04,较执行日期晚 2 天)

今日精选

1. 跨模型 KV 缓存迁移:闭式线性映射实现预填充复用

  • 原标题: Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
  • 作者/机构: Taekyung Heo 等(NVIDIA)| arXiv
  • 核心贡献: ① 解决生产环境中同系列不同规模模型切换(成本质量级联、会话中途切换、路由)时必须从头重算 prefill 的问题 ② 发现跨模型 KV 缓存存在显著线性结构,设计闭式岭回归映射器:逐层选取 top-k 源层拼接 KV、剥离 RoPE 后拟合(位置无关、可跨上下文长度复用),仅需 500 条 1K token 校准序列 ③ Qwen3 14B→32B 单源层即可解释 56% 的 key 方差;6 组配对中 4 组保留 73-98% 的独立 prefill 准确率,映射速度比重新 prefill 快 2.7-25 倍,多轮切换保持稳定
  • 工程关联: LLM 服务部署/推理优化方向:为多模型路由与级联切换场景提供 KV 复用方案,直接降低切换延迟与算力开销
  • 价值点: 让”换模型不重算上下文”成为可行,是多模型混合部署的实用加速路径

2. 可解释的自适应采样:为 LLM 测试时扩展按查询分配算力

  • 原标题: Interpretable Adaptive Sampling for LLM Test-Time Scaling
  • 作者/机构: Mobina Kashaniyan, Ali Jannesari(爱荷华州立大学)| arXiv
  • 核心贡献: ① 指出现有测试时扩展多用固定采样预算,简单与困难问题消耗相同算力且不可审计 ② 提出轻量模糊控制器,将”估计提示复杂度 + 模型置信度”映射为每查询采样预算:简单/高置信问题少采样,难题多采样 ③ 在公平对齐协议下对比 best-of-N、compute-aware scaling、自置信基线,QA 与数学推理任务上多数场景更优,且平均采样数更低
  • 工程关联: 推理成本优化方向:把测试时扩展算力按难度动态分配,适合预算敏感的大模型服务
  • 价值点: 提供可解释、可审计的推理算力分配方案,减少平均采样开销

3. ContinualSkillBench:LLM Agent 真的能进化能力吗?

  • 原标题: ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
  • 作者/机构: Tianyi Guan, Yiding Wang 等(北京大学人工智能研究院 · 北京通用人工智能研究院)| arXiv
  • 核心贡献: ① 质疑现有 Agent 框架外部技能库是否真能演化出可复用技能 ② 提出动态评估框架,覆盖 5 个领域、每领域 100 个难度递增且支持跨任务技能复用的互连子任务 ③ 实验发现顺序执行普遍提升表现,但提升主要来自上下文与反馈适应而非技能抽象;较弱模型反而积累更大、更碎片化的任务专属技能集
  • 工程关联: Agent 开发方向:指导技能库设计取舍——显式技能仅在需要可复用流程或精确输出时带来选择性收益
  • 价值点: 帮助 Agent 工程团队判断何时值得构建显式技能库,避免过度设计

4. TurnSight:面向工具集成推理的回合级后见自蒸馏

  • 原标题: TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
  • 作者/机构: Changle Qu 等(中国人民大学高瓴人工智能学院 · 百度)| arXiv
  • 核心贡献: ① 指出工具集成推理(TIR)中轨迹级 RL 监督难以完成长程细粒度信用分配 ② 提出回合级后见自蒸馏框架:从执行条件化后见中构造不同 lookahead 视野,用跨视野方向一致性筛选可靠监督,再跨兄弟 rollout 归一化后自适应调制 RL 优势,保持原始优化方向 ③ 三个基准上验证有效,代码开源
  • 工程关联: Agent/RL 训练方向:为长程工具调用场景提供比 token 级更粗、比轨迹级更密的监督信号
  • 价值点: 改进 TIR Agent 的 RL 训练效率与长程信用分配能力

5. SciRet:面向科学 RAG 的算力感知检索与重排实证研究

  • 原标题: SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG
  • 作者/机构: Kaysarul Anas Apurba 等(劳伦森大学 · 南北大学)| arXiv
  • 核心贡献: ① 对固定科学 RAG 流水线(句子窗口切分 + BM25 + BGE-M3 稠密检索 + 倒数排名融合 + 可选 cross-encoder 重排)在 1K/5K/15K 三档语料规模下做算力感知评测 ② 混合检索最稳健,Recall@10 在 1K 与 15K 均达 1.000;MS MARCO 训练的 cross-encoder 重排在科学语料上反而降低精度(领域不匹配)③ 生成忠实度(RAGAS)随语料规模提升,代码与索引开源
  • 工程关联: RAG 落地方向:域外重排模型可能有害,混合检索 + RRF 是稳健的默认配置
  • 价值点: 为 RAG 管线组件选型提供算力与规模维度的实证参考

今日关键词

测试时扩展 test-time scaling · 自适应采样 adaptive sampling · KV 缓存迁移 KV cache transfer · Agent 技能学习 continual skill learning · 工具集成推理 tool-integrated reasoning · 后见自蒸馏 hindsight self-distillation · 科学检索增强生成 scientific RAG · 混合检索 hybrid retrieval