推理可以通过极少一小部分生成标记有效激励——每条推理轨迹仅需一到两个标记
Extremely Sparse Supervision Incentivizes Reasoning Ability
待检验的假设
作者重新审视了后训练(post-training)的一个具体前提:现行方法在大规模标记上优化,因而隐含地假设学习必须依赖大量标记。在 on-policy 蒸馏(OPD)中,他们改为测试学生模型是否仅从其每条生成的推理轨迹中的少数选定位置学习。报道的下限为每条轨迹一到两个监督标记,约占生成标记的 0.05%(paper, abstract)。
训练目标发生的变化
稀疏 OPD 不再在每个生成位置保留损失贡献,而是仅保留选定的标记位置。被测试的选择器包括每条轨迹一个均匀随机标记(rand1tok)以及基于 OPD 奖励极值的选择器(mintok、maxtok 和 minmaxtok)。因此,监督密度——而非仅仅是教师、数据或 rollout 数量——成为一个可控的实验变量。论文报告称,在其 Qwen3 数学推理设置中,“rand1tok 在所有九个教师—学生家族中持续提高了基础学生的推理能力”(§4)。
决定性证据及诊断性警告
在九个 Qwen3 教师—学生家族中,作者报告“我们总能识别出一种稀疏 OPD 变体,其在推理能力边界和采样效率上要么匹配(九个家族中的两家),要么超过(九个家族中的七家)普通 OPD。” 这是他们在所报告数学评估下与稠密 OPD 的主要比较(§5)。
该结果并不意味着更好的推理得分必然来自于与教师更接近的分布匹配。作者报告“许多表现最好的稀疏 OPD 变体的逆 KL 散度比普通 OPD 更大。”在此设置中,逆 KL 的下降因此并不是下游推理性能的充分代理。
可迁移的实验
在固定的 on-policy rollout 预算下,比对稠密 OPD 与随机一标记和基于奖励极值的掩码。一起测量任务性能与逆 KL,然后询问:哪个选择器最匹配教师,是否也正好是最能改进推理的选择器?这直接检验在特定训练制度中,稠密标记修正是有用信号还是有害的过度约束。
边界
作者提醒他们的研究“主要在 Qwen3 家族上进行,关注数学推理任务,并在 Llama 家族上做了额外验证。”他们还报告了在编码推理和稀疏 PPO/RLVR 上的验证,但稀疏 OPD 仍使用与稠密 OPD 相同数量的 on-policy rollouts;论文指出这些 rollouts 占主导计算和训练时间。因此,单纯的稀疏掩码不应被解读为整体运行时减少。
该工作给出了一个具体消融,用于测试单标记或奖励极值监督能否在不减少 on-policy rollout 预算的情况下替代稠密 OPD 损失项。
来源位置
缓存干预在所测混合语言模型中将精确检索与语言控制区分开来
What Attention Recalls and Recurrence Controls in Hybrid Language Models
混合语言模型将注意力与定长循环状态结合,但这两条通道在推理时各自承担的角色仍不清楚。本文把该模糊性转为一个因果问题:当训练好的混合模型从上下文作答时,哪条通道驱动答案的精确内容,哪条通道驱动其回应模式?实验覆盖 Qwen3.5 和 Falcon-H1 混合家族。arxiv:2609.04434v1
该方法包含两种有用的干预。在 split-prefill 中,作者先填充上下文,然后对共享查询作答,同时仅保留注意力的 KV 缓存或循环状态,得到完整、仅 KV、仅循环三种条件。在 state-swap 中,他们先填充两个在相关属性上存在分歧的上下文,然后组合缓存:一侧的 KV 与另一侧的循环状态。后者测试的价值在于它询问一条单独生成的答案遵循哪一侧,而不是仅比较在消融后的性能差异。研究使用程序化检索和行为诊断,包括 KV 检索、列表索引、语言遵循和人格任务,并采用贪心解码。arxiv:2609.04434v1
在 KV-检索与列表索引诊断上,KV-only 保留了完整模型 64–98% 的准确率,而 recurrence-only 的准确率为零。输出语言和人格则呈现相反的模式:摘要报告称语言与人格通过循环状态得以保留,而 KV-only 的语言准确率降至约 1%。state-swap 提供了决定性的归因:生成的具体值遵循 KV 侧的上下文,而输出语言遵循循环侧的上下文。在仅循环生成条件中,模型也接受了一些在上下文中并不存在但在语义或形态上相关的词,而不是把存在性视为精确查找问题。arxiv:2609.04434v1
作者将此解读为:KV 通道充当可寻址的 KV 存储以查回特定条目,而循环通道提供压缩的循环先验以塑造语言、人格和语义场。该解读刻意保持有限:这些干预识别的是在推理时每条通道“因果驱动”的内容,而不是静态地说明任一表示中被编码了什么。split-prefill 也破坏了两条通道的正常共更新,可能产生部分违背数据分布的缓存组合;state-swap 缓解了但并未完全消除该顾虑。arxiv:2609.04434v1
一个可迁移的研究操作是:使两个上下文在可分离属性上产生分歧——例如事实值与输出语言指令——然后交叉交换内部通道并独立评分每个属性。作为后续工作,可以询问该结果在替代解码策略下是否仍然成立,以及通过哪种控制来量化破坏正常通道一致性所带来的干扰。
阅读此文以将 split-prefill 与 state-swap 作为因果检验手段,判断不同记忆通路是在检索精确上下文项还是在引导生成行为。
来源位置
幻觉空间投影在推理时减少 Whisper 的非语音幻觉
Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection
Whisper 的生成式解码器在输入含有很少或没有语音时仍可能产生流畅的幻觉转录。这里针对的具体限制是非语音拒绝(non-speech rejection),而非对所有 ASR 幻觉场景的通用解决方案。WhisperX 通过外部 VAD 的 Cut & Merge 与独立分段转录来缓解这一失败。Calm-Whisper 则通过有针对性的微调改变部分解码器参数。本文再次改变了干预点:在推理时修改解码器激活,而不更新参数。
对于每个解码器层,作者构造了在产生幻觉的非语音示例与被正确拒绝的非语音示例之间的激活差异。使用 SVD 将这些差异压缩为一个 rank-\u001br\u001d 与幻觉相关的子空间。在推理时,选定的解码器隐藏状态以 h_l - α(h_l Bᵀ)B 替换,从隐藏表示中去除与学习到基向量对齐的分量。该投影可以始终开启,或通过门控使其仅在 Whisper 的初始 no_speech_prob 超过 γ 时运行;最终拒绝仍使用 Whisper 的无语音阈值。因而门控变体不需要外部 VAD。
报道的非语音结果幅度很大:始终开启投影将平均幻觉率从 31.31% 降至 2.44%,而门控投影将其降至 3.74%。然而在 LibriSpeech 上,门控投影会使绝对 WER 增加 0.33–4.39 个百分点,并在不同模型与分割设置上产生 0.41–9.97% 的假拒绝率(FRR)。操作点选择很关键:在 large-v3 validation-clean 开发选择中,使用 layer 28、rank 4、α=1.0 与 γ=0.05 时,始终开启投影的 WER 为 11.59% 且 FRR 为 9.69%,而门控投影的 WER 为 5.32% 且 FRR 为 1.85%。
作者将子空间的估计固定在 ESC-50 开发折上,并在留出的 ESC-50 折、UrbanSound8K 与过滤后的 FSD50K 上报告了降低效果;他们据此将其解读为一个可复用的解码器级签名,而非 ESC-50 特定的声学效应。一个有用的研究操作是:在一个非语音校准语料上估计子空间并冻结它,然后在部署类似的分布偏移下扫查 α 和 γ,测量 HR、WER 与 FRR。关键问题不是是否存在某一设置能抑制幻觉,而是该设置在何处其操作点仍可接受。
边界明确。研究未评估长文本转录、多语音频或声学上模糊的输入。论文还报告了 HR–WER–FRR 的权衡,且门控投影依赖于 Whisper 的内部无语音概率;因此从校准到部署的分布迁移可能会改变首选设置。
阅读此文以了解低秩激活干预如何在不重训练的情况下针对特定 ASR 失败模式,并如何在校准迁移下评估由此产生的幻觉、语音错误与假拒绝之间的权衡。
来源位置
同伴上下文可使单独校准的保形证书失效
Conformity Breaks Conformal Prediction
在模型单独回答时校准的保形证书(conformal certificate)在同一问题与一致给出错误答案的同伴信息同时出现时可能会出现覆盖不足。Hu 与 Su 将该失败表述为一种分数—机制转移(score-mechanism shift):问题分布保持不变,但同伴上下文改变了模型条件化下的非符合性分数行为。在他们的设置中,得分为 1 − p_gt,其中 p_gt 是分配给真实答案选项的概率;因此校准证明的是单独的评分机制,而不一定是受压力时的评分机制。[§4.1]
实验隔离了这一不匹配而不是改变问题集。作者在 round-1 的单独分数上使用 LAC 对分裂(归纳)保形预测进行校准,然后对一致错误的同伴转录进行部署。他们报告了在 ARC-Challenge 与 TruthfulQA 上对开放权重模型的汇总结果,使用 2,000 次随机的 50/50 校准/测试分割与标准的 α = 0.10 操作点。[§3.1; Appendix F]
在该条件下,名义上的 90% 覆盖率下降到约 74%。作者提出的机制是阈值越过:同伴压力将概率质量从正确答案移开,使得先前保留在预测集合中的条目可能降至固定的保形阈值之下。关键在于被监测的输入变量并未漂移——问题完全相同——因此这并非普通的协变量漂移情形,后者是重加权方法所设计去处理的。[§3.1; §4.2]
论文还报告了对熟悉修复方法的负结果。基于问题的加权保形校正在此处给出 w(x)=1,因此退化为恒等。按模型(Mondrian)校准消除了一些池化伪影,但在 α = 0.10 下,报道的评估中四个模型中仍有三个低于目标覆盖率。[§4.2–§4.3]
一个可迁移的研究操作是测试评分机制,而不仅仅是准确率或问题分布。固定问题与单独校准的阈值;引入受控的同伴上下文;然后测量 p_gt、答案翻转与覆盖率的变化。这直接检验证书在模型实际将要行动的上下文中是否仍然成立。
范围有限。作者明确不主张普遍的一致性失败。他们测试出的有效修复——条件感知的重新校准——需要带有压力标签的校准数据,防御方可能事先并不具备;该方法通过将集合放宽直到决策层几乎把所有东西都升级来恢复覆盖率。[§8; §4.4]
阅读此文可将保形校准评估转为上下文扰动压力测试:保持问题不变、扰动同伴消息,并测量正确答案分数是否越过部署阈值。
来源位置
PatchBench 发现仅 PoC 验证会使 C/C++ 代理补丁的解决率平均膨胀 1.83×
PatchBench: Evaluating AI Agents for Vulnerability Patching
评估差距
PatchBench 检查了两种可能导致对代理过高估计修补能力的方式:其补丁可能在很大程度上类似于历史开发者修复,或可能在给定的 sanitizer 报告位置附近抑制了提供的 proof-of-concept(PoC)崩溃而未修复潜在的根本漏洞。在作者的 SEC-bench 研究中,按他们的 DiffBLEU 阈值与实验设定,记忆化补丁的估计比例从本地上下文提示的 11% 上升到仓库级代理的 25%。
基准的变化
DiffBLEU 将当生成补丁的分数超过 0.75 时操作化地视为记忆化生成。基准随后通过改变任务构建来补偿这一点,而不是仅依赖检测器:选择那些真实修复不在崩溃栈内的漏洞,将历史漏洞移植到较新的仓库上下文,并在补丁位置应用代码变异。由此得到的 PatchBench 包含来自 32 个项目和 16 个 CWE 的 213 个 C/C++ 任务,且配有人工策划的参考补丁。
验证也变为两部分的行为测试。安全条件要求:在任务的崩溃语料库中每个在易受攻击仓库中触发目标 sanitizer 错误的输入,在代理补丁后不再导致 sanitizer 错误。语义验证则将代理补丁后的仓库与参考补丁后的仓库在良性输入上比较,检查 sanitizer 回归、可观测输出状态的一致性以及单元测试。崩溃与良性语料库由定向与非定向模糊测试生成,每个任务运行 10 分钟。
决定性结果及其局限
在 PatchBench 上的 11 个代理中,原始 PoC-仅验证平均将解决率膨胀了 1.83×。在论文的 $5-per-task 限制与禁止外网访问的设置下,前三名代理通过了超过 97% 的原始 PoC,但在结合安全与语义验证下仅解决了大约一半的任务。该差距证明原始 PoC 的通过应与更广泛的修复成功声明分开报告。
更广泛的协议仍然不能证明根因已被移除。作者报告其模糊测试生成的输入语料不完整:人工审查发现通过验证的 Atlantis 补丁中有 6.8% 存在部分未修复的根因,Codex 为 7.1%。部署上还有第二个约束:如果没有参考补丁仓库,就无法进行语义比较。
一个可迁移的研究操作是:围绕代理可能利用的捷径设计修复评估:改变历史任务上下文、衡量补丁相似性、生成多个对抗性输入,并区分崩溃抑制与被测试的具体行为属性。将每个通过的语料库视为覆盖的证据并指明其缺口,而非作为完整的正确性证明。
学习一种用于代理式漏洞修复的具体评估设计,将历史补丁相似性、崩溃抑制、安全测试与语义行为区分开来。