来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-10-01)

今日精选

1. AutoCompact:让编码 Agent 自己学会”何时压缩上下文”

  • 原标题: AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents
  • 作者/机构: Xuan Zhang、Longtao Zheng、Cunxiao Du、Bo An、Xin Dong(南洋理工大学,据 Bo An 团队推断,页面未全标注)| arXiv
  • 核心贡献: ① 解决长时程编码 Agent 的上下文管理问题——不只是防溢出,还要决定何时压缩、保留哪些工作状态、如何从压缩后继续 ② 将压缩决策纳入 Agent 策略本身:先用 judge 审查基线 Agent 的压缩决策并修正生成训练轨迹做 SFT,再用任务成功奖励做 RL 联合优化编码与压缩 ③ SWE-bench Verified 绝对提升 9.2%,SWE-PolyBench Verified 提升 5.0%;256K 窗口永不溢出,16K 窗口触发回退压缩时同样有效
  • 工程关联: 直接面向 Agent 开发中最棘手的 context engineering 问题——长任务轨迹中”早期探索信息变陈旧”是所有 coding agent(Claude Code / OpenHands 类)的共同痛点,本文给出”把压缩做成可学习策略”的完整训练配方
  • 价值点: 提供了一条从数据构造(judge 修正轨迹)到 SFT+RL 的可复制流水线,适合任何需要长时程上下文管理的 Agent 产品直接借鉴

2. Finetuning with Sampling:用 MCMC 采样改造数据分布,SFT 泛化能力大幅低估

  • 原标题: Finetuning with Sampling: SFT Learns Better Than You Think
  • 作者/机构: Aayush Karan、Sitan Chen、Yilun Du(哈佛大学)| arXiv
  • 核心贡献: ① 挑战”RL 泛化好、SFT 易灾难性遗忘”的惯例认知 ② 不改学习目标,而是用 MCMC 采样算法把 off-policy 专家轨迹逐步变换为更接近 on-policy 的分布,再喂给 SFT ③ 在科学技能习得、数学推理、开放式专长任务上,SFT 可与主流 post-training 技术抗衡,泛化更好、遗忘更少
  • 工程关联: 对模型微调方向的工程团队意义重大——无需搭建复杂 RL 训练设施,仅通过”采样改造数据”即可获得接近 RL 的效果,训练栈大幅简化
  • 价值点: 把”采样”定位为 post-training 栈中的模型原生算子:手头只有专家数据没有 RL 基建时,这是成本最低的高质量微调路径

3. Argo-Bench:在 235 表 / 75 亿行的企业级数仓里评测数据 Agent

  • 原标题: Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
  • 作者/机构: Gabriel Tomitsuka、Arman Raayatsanati、Emma Xing、Duke Gand、Joseph J Ma(TextQL Labs)| arXiv · 代码 · 数据
  • 核心贡献: ① 现有 text-to-SQL 基准只测单表查询生成且答案键错误率高,企业真实场景需要跨数十张表推理 ② 用模拟器构建纽约外卖平台真实规模世界(8100 万订单),导出为 Oracle EBS 模式的 235 表 / 75 亿行 ERP 数仓,Agent 需在数仓中导航重建事实后执行动作(封禁欺诈账号、分配骑手激励预算等),按模拟器中的后果打分 ③ 14 个前沿及开源模型中最强者仅 34.8% 任务达到 95+ 分,平均 59.5 分
  • 工程关联: 数据 Agent / ChatBI 方向目前最接近真实企业环境的评测框架;每个任务都有可执行参考解,保证只用数仓即可求解
  • 价值点: 揭示前沿模型在真实规模数仓上的巨大差距(59.5 分),为数据 Agent 产品的能力评估和迭代提供了可复用的开源基准

4. KaliBench:度量 LLM 网络安全命令行工具调用的细粒度基准(NeurIPS 2026)

  • 原标题: KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
  • 作者/机构: Pengfei Li、Naufal Suryanto、Sicheng Zhang、Muzammal Naseer(Khalifa University · University of Western Australia)| arXiv · 代码
  • 核心贡献: ① 现有评测只测知识问答或端到端任务,不测”自然语言→可执行 CLI 命令”的精确转换(旗标-值绑定、参数顺序错误即失效)② 基于 Kali Linux 手册构建 8,504 对查询-命令、覆盖 1,642 个工具、23 个能力维度、5 个安全阶段,配合确定性规范化与别名感知评测,多级验证(LLM 校验+沙箱执行+人工精修)③ 开放权重模型在无提示设定下最高仅 42% 精确命令准确率;用其可验证奖励做 SFT+RL 后 8B 模型可达 685B MoE 水平
  • 工程关联: 安全 Agent / 工具调用方向的细粒度评测范式;“runtime-free 可验证奖励”思路可迁移到任何有确定性 CLI 语法域的工具调用训练
  • 价值点: 证明了细粒度确定性奖励的杠杆效应——8B 模型对齐到 685B 水平,小模型+领域验证器是高性价比路线

5. TACO:优化器状态压缩 174 倍,单卡 H100 全参微调 30B 模型

  • 原标题: TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning
  • 作者/机构: Jichao Jiang、Cristian McGee、El Houcine Bergou、Hanqin Cai、Aritra Dutta(University of Central Florida · Mohammed VI Polytechnic University)| arXiv · 代码
  • 核心贡献: ① 解决全参微调的优化器状态显存开销问题:Muon 优化器虽省显存但几何形状与 AdamW 不兼容,微调 AdamW 预训练模型时性能受损 ② 在 Muon 的算子范数最速下降框架上更进一步,按维度归一化 1→1 算子范数取每列绝对值最大分量的符号作为方向,保留一阶梯度且优化器状态近乎归零 ③ 相对 AdamW8bit 持久优化器状态减少 174 倍(27.7GB→0.16GB)、峰值训练显存降低 2.9 倍(80.6GB→27.5GB,OPT-13B),精度与运行时间相当;单张 80GB H100 可全参微调 30-32B 模型
  • 工程关联: 模型部署/训练基础设施方向——对受限于 GPU 显存的微调场景,可免去 LoRA 等近似手段直接全参训练
  • 价值点: 代码开源;174 倍优化器状态压缩意味着中小团队用单卡即可全参微调 30B 级模型,直接改变微调成本结构

今日关键词

上下文压缩(Context Compaction)· 编码 Agent(Coding Agent)· SFT vs RL · MCMC 采样(On-Policy 化)· 数据 Agent(Data Agent)· 工具调用评测(Tool-Use Benchmark)· 可验证奖励(Verifiable Rewards)· 优化器显存压缩(Optimizer State Compression)