来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-09-30)

今日精选

1. 半事实信用增强策略优化:让 RLVR 训练对提示词扰动更鲁棒

  • 原标题: Semifactual Credit-Augmented Policy Optimization
  • 作者/机构: Junshu Pan 等(浙江大学 ZJU · 西湖大学 · 上海创新研究院 · 上海AI Lab)| arXiv
  • 核心贡献: ① 发现 GRPO 对所有 token 赋予相同的结果优势,会强化对任务无关提示特征的伪相关依赖 ② 提出 SCAPO,通过”半事实提示干预”(保持问题与答案不变、扰动无关特征)度量 token 概率漂移,把稳定性分数归一后纳入 GRPO 的 token 级信用分配,训练早期下调不稳定 token 的优势 ③ 在 Qwen3-4B/1.7B-Base 上,AIME 2024-2026 准确率比 GRPO 分别提升 5.63 和 4.17 个百分点,多数数学基准与全部 OOD 基准取得最佳
  • 工程关联: 对 RLHF/RLVR 后训练方向直接可用——无需改模型权重即可在解码期抑制高漂移 token 提升推理精度;开源代码见 github.com/DtYXs/SCAPO
  • 价值点: 给出了比 GRPO 更细粒度的信用分配方案,直接缓解 LLM 推理训练中最常见的”提示敏感、换个说法就崩”问题

2. 强模型真的需要复杂 Agent Harness 吗:大规模消融研究说不需要

  • 原标题: How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?
  • 作者/机构: Kirill Brilliantov 等(EPFL · Apple)| arXiv
  • 核心贡献: ① 针对 MLE Agent 越做越重的趋势(多 Agent 编排、专用检索子 Agent 等),在相同时间预算与同一前沿 LLM 底座下系统对比 ② 发现开源 SOTA harness 相比”最小 harness 的单会话编码 Agent 基线”没有任何优势,性能主要由底座模型驱动 ③ 大规模消融进一步表明各类机制层在编码 Agent 场景下趋于冗余,围绕强模型手工堆叠 harness 的投入回报很差
  • 工程关联: 对 Agent 工程架构选型是直接的反面证据——在为强模型搭建多 Agent 编排前,应先验证最小 harness 基线
  • 价值点: 一篇能帮团队砍掉过度工程的文章:底座升级可能比 harness 加层更划算,省下的是实打实的开发与维护成本

3. Green 算子透视多任务循环网络:计算如何被跨任务复用

  • 原标题: Disentangling Computation in Multi-Task Neural Networks with the Green’s Operator
  • 作者/机构: James Hazelden(华盛顿大学 UW · Allen Institute,NeurReps 2026 接收)| arXiv
  • 核心贡献: ① 研究训练后的循环神经网络中计算如何在任务与时间维度上组织和复用 ② 用有限时域 Green 算子刻画网络的全局一阶扰动响应,直接表示”扰动路由”;其简单约化给出同一计算的”任务到任务”与”时间到时间”两种视图,matrix-free 乘积免于构造完整算子 ③ 在多任务循环网络中揭示已知计算 motif 的结构化复用,以及因果通路在训练中的涌现过程
  • 工程关联: 对模型可解释性与多任务模型诊断有方法论价值——提供了比活动几何/动力学 motif 分析更直接的因果视角
  • 价值点: 一套可落地到任意 RNN 的扰动路由分析工具,用于判断哪些计算是共享的、哪些是任务专属的

4. 开源模型微调逼近 GPT-4o:放射报告实体抽取的受控对比

  • 原标题: Comparison of techniques for fine-tuning open-weight models for entity extraction from radiology reports
  • 作者/机构: Aawez Mansuri 等(Emory University)| arXiv
  • 核心贡献: ① 用 2×2 实验设计(分类头 vs 指令微调 × 真实 GPT-4o 标注蒸馏 vs 合成数据)对比 Gemma-3-12B 提取颅内出血急性度标签的效果 ② 蒸馏+指令微调(DIFT)达到 macro-F1 0.845,与 GPT-4o 的 0.850 统计上无差异;决定因素是训练数据来源而非微调方法——合成数据模型在任何规模下都不如未微调基座 ③ 全流程可塞进单张 24GB 消费级 GPU
  • 工程关联: 对垂直领域 LLM 应用(医疗文本结构化)的数据策略极具参考价值:蒸馏真实高价值标注远胜合成数据
  • 价值点: 给出了私有化、低成本替代闭源 API 的完整可行路径,且明确了”数据来源 > 微调方法”这一关键结论,适用于各类窄域高价值抽取任务

5. Debias It Yourself:把认知科学中的去偏干预教给 LLM

  • 原标题: Debias It Yourself: Teaching LLMs Cognitive Bias Mitigation Interventions
  • 作者/机构: Chahat Raj 等(乔治·梅森大学 George Mason University · 华盛顿大学 UW,Under Review)| arXiv
  • 核心贡献: ① 把社会心理学几十年积累的五种经过验证的人类去偏干预转化为 LLM 去偏流程 ② 通过 Show(上下文示例)/ Train(指令微调)/ Revise(引导自修订)三种范式交付,在 3 个模型 × 5 个偏见基准 × 11 个基线中,Train+Revise 与 Revise alone 稳居前二 ③ 偏见-推理权衡最佳:平均偏见低至 2% 时推理准确率保持 90%,对未见偏见维度最高降低 14.8%;代码数据公开
  • 工程关联: 对 AI 安全与对齐工程实用——无需重训即可用”自修订”范式显著降低模型刻板输出,且几乎不牺牲推理能力
  • 价值点: 提供了一套认知科学背书的、可即插即用的 LLM 去偏工具箱,Revise 范式对生产环境零训练成本的场景尤其友好

今日关键词

RLVR 信用分配 · Agent Harness 工程 · Green 算子可解释性 · 领域蒸馏 vs 合成数据 · LLM 去偏 · GRPO 变体 · 开源模型微调 · 多任务表征分析