2026-10-05
2026-10-05
在 GridUMM 中,压低测得的冲突并未改善下游权衡
此前的局限在于证据不足:减少冲突指标就能改善下游权衡这一前提,尚未经过直接检验。本文改变了研究操作:不再把冲突视为优化目标,而是先检验它的预测效度,再对其进行干预。
GridUMM 在完全共享的双任务模型中,将这一审计操作化;该模型具有非对称的任务结构和 token 预算,因此可以精确计算合成权衡。作者改变七种梯度组合策略、三种数据比例和三个随机种子,在固定探测批次上测量方向冲突和梯度范数不平衡,并将早期测量结果与最终 Pareto 分数进行比较。在前瞻性分析中,冲突是在训练预算的 25% 处测量的,涵盖 63 种基础规模配置。
关键的预测结果较为谨慎:在这一测试环境中,早期方向性梯度冲突指标与最终权衡之间没有显示出中等程度且可在统计上区分的关联。报告中最强的关联是冲突幅度,ρ = −0.198,95% CI 为 [−0.463, 0.079]。与再做一次相关性分析相比,因果检验更有信息量:随着投影强度 α 从 0 增至 1,有效冲突从 0.005 单调下降到 0.000,但最终 Pareto 分数仅变化 0.005,而每种剂量下的标准差均值为 0.028;报告的剂量—结果相关性为 ρ = −0.600,p = 0.285。换言之,这项干预压低了测得的代理指标,却没有带来相应的下游权衡单调改善。
审计还指出,冲突指标可能混淆了什么。作者将范数比的总体关联解释为一种生成失败检测器:在掌握生成任务的配置中,它与 Pareto 分数的相关性为 ρ = +0.02。作为功能性表征度量的有效秩,其相关性达到 ρ = 0.702,而最佳方向性指标为 −0.187;最终联合训练损失的相关性为 ρ = −0.926;早期损失的预测能力则较弱,且存在不确定性。
可迁移的操作是在代理指标将要使用的条件下验证它:预先登记早期读数,改变训练条件,报告不确定性,并通过干预确认代理指标确实发生变化。不要将这些结果解读为对生产规模模型的定论。测试环境使用的是 3.2M–6.7M 参数的合成语法;生成能力通常已饱和,而针对 63 种配置的分析对较小关联的检验效能有限。作者的结论更为有限:冲突仍可能重要,但必须验证其诊断效度,而不能想当然地认定它有效。
阅读本文,了解如何在把训练期间的代理指标变成优化目标之前,检验它是否能预测最终权衡。
abstract; Section 3.1; Section 4.2; Section 4.4; Section 5, Limitations
CESS 审计自适应搜索是否代表固定证据池
Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents
深度研究评估往往止步于引用正确性:检查被引用来源是否支持个别论断。论文指出,此外还有一个独立的选择问题:早期发现会影响后续查询、文档选择和停止时机,因此实际阅读的文档只是候选池中的一个选择性样本。
CESS 明确了审计目标。它估计的是一个固定且预先指定的候选池中、各文档证据方向等权平均后的结果,而不是开放网络或终极真相;它的文档分数编码的是报告结果的方向,并不代表证据有效性、效应大小或临床获益。该估计器预测每份候选文档的方向,并利用已记录的文档入选概率和到达相应搜索轮次的概率,对已打开文档的平均值进行校正;收缩处理可稳定较短的搜索,而在某些文档无法被抽样时,则用区间取代点估计。
理论保证具有条件性。轨迹开始前必须固定预测;记录的选择概率和继续搜索概率必须与控制器相符;每份候选文档和每个被评估轮次都必须有正的抽样概率。作者提醒,截断、估计概率或设定错误的继续搜索模型可能引入对策略的依赖,而无法访问的文档则需要用界限处理,不能作点识别。
在 MS2 上的实证结果显示,与已打开文档的均值相比,稳定化 CESS 将平均绝对误差降低了 9.2%,排序敏感度降低了 39.4%,最差排序的 MAE 降低了 14.2%。在一项小规模公开智能体迁移评估中,MAE 和排序敏感度分别降低了 60.1% 和 87.2%,方向错误减少了 18.1 个百分点。
这些收益应限定在具体设置中解读。在一项十轮 PERSPECTRUM 分析中,固定调优集均值在 MAE 和方向分歧上优于报告的 CESS 配置,尽管其排序敏感度为零;在准确率匹配的比较中,CESS 在 28 个案例中的 10 个具有更低的排序敏感度,在 18 个案例中未检测到差异,在任何案例中都没有更高的敏感度。
最重要的是,CESS 对比并不是改变搜索行为的因果估计:在 MS2 上进行的配对干预中,CESS 对比与干预效果之间的相关性仅为 0.269 和 0.236。对于研究评估,应预先指定候选池和评分方式,记录选择概率与继续搜索概率,诊断覆盖情况,并对无法访问的文档使用界限;如果要回答的是策略改变会如何影响实际阅读的证据,就应进行配对干预,而不是把候选池目标校正重新解释为策略效应。
用这篇论文来设计评估,区分智能体是否从固定候选池中抽取了有代表性的样本,以及其搜索策略导致它实际阅读了什么。
abstract; §3.1, Theorem 1 and S3.SS1.p2
排除来源的反馈降低了审计测得的共同作弊
False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
为什么反馈闭环会失效
自我进化的搜索智能体可能会优化一个误导性的内部信号:在标准的耦合闭环中,提议器和求解器会越来越认同彼此共享的错误,因此内部奖励不断提高,却没有相应提升外部正确性。论文将这种失效模式称为共同作弊。具体局限在于存在这样一条反馈路径:源自某个来源的错误可能同时成为伪标签监督信号和提议器奖励。
作者首先通过事后审计,依据来源证据诊断这一闭环;审计器不会改变任务准入、模型更新或提议器奖励。随后,作者比较了两种干预。多样本验证(MSV)对同一模型进行三次有来源查询和三次无来源查询;当两种多数意见一致时,才接纳提议,并将草稿标签替换为这一共识。交叉拟合则将来源文档划分为 A 和 B 两折:来自 A 的问题由仅在 B 上训练的辅助求解器提供提议器反馈,反之亦然。主求解器仍使用来自两折的已接纳问题进行训练,因此交叉拟合改变的是反馈来源,而不是主求解器的更新规则。这消除了同一来源直接连接训练与反馈的路径,但并未使辅助求解器成为真相预言机。
关键比较是报告中使用 Qwen3.5-4B 和 Qwen3.5-9B 得到的第 3 轮审计结果。标准耦合反馈在这两种规模下产生的虚假一致质量分别为 6.1% 和 8.8%。MSV 将这两个数值降至 5.7% 和 7.2%,交叉拟合则将其降至 3.0% 和 3.7%。使用排除来源的反馈重放完全相同的提议后,虚假一致进一步降至 0.4% 和 0.1%,支持了论文关于反馈来源谱系很重要的解释。在七项下游搜索基准上,与标准耦合式自我进化相比,交叉拟合在 4B 规模下使平均表现提高 8.8 个百分点,在 9B 规模下提高 8.4 个百分点;与 Search-R1 相比,提升幅度分别为 8.7 和 7.8 个百分点。
这些结果有重要的适用条件。MSV 为每个候选任务增加六次标注器生成;主要交叉拟合配置每轮增加 50 次辅助求解器更新。报告的预留预算中,MSV 约增加 90%,交叉拟合增加 72% 或 79%。按来源排除也无法保证错误相互独立,因为模型可能共享预训练数据或相关证据。虚假一致质量降低可能反映了困难任务被拒绝,因此还应同时报告覆盖率、任务难度、固定探测集表现和下游能力。审计由大语言模型评判,论文指出评判者可能存在系统性偏差,但未报告人工验证结果。
研究操作:为每个伪标签附上来源谱系,用来源内反馈和排除来源的反馈重放同一提议集,并将虚假一致与覆盖率和外部能力一并测量。关键问题是:当任务选择保持不变时,改进是否仍然存在。
阅读本文,了解一种针对自训练闭环的具体溯源测试:审计共享错误,让反馈求解器排除相应来源,并在信任不断上升的一致性奖励之前重放同一批提议。
植入路径表明:位置级距离无法验证干预机制
Right Answer, Wrong Mechanism: Detecting Pernicious Divergence in Causal Interventions
激活修补和分布式对齐搜索(DAS)可能通过一条休眠路径产生预期答案,而非沿着模型的自然路径。论文指出,实际存在的缺口是:目前没有方法能够区分这两种情况。
为使这一问题可检验,作者在预训练的 GPT-2 small 中植入隐藏路径。这些路径按构造在所有基准提示上都保持沉默,因此,路径开启与关闭时的行为构成了判断干预是否依赖这些路径的真实标签。在 72 种配置和 100,800 次干预中,论文将干预位置的最近邻距离和局部 PCA 距离,与隐藏路径贡献(HPC)进行比较。HPC 是一种无需标签的测试:它将下游单元钳制在同一输出对应的自然运行状态,并测量有多少决策因此消失。
这一比较改变了证据的判定标准。在成功的干预中,最近邻距离和局部 PCA 距离在所有报告的设置下,对依赖植入路径的成功案例的排序都低于随机水平(AUROC 0.35–0.47)。当植入路径导致单元级别的分布外活动时,HPC 的 AUROC 可达 >=0.99,但其效果有条件限制:在使用范围内组合路径的成功性别任务干预中,HPC-L 接近随机水平(AUROC 0.54)。
优化还会带来另一种风险。在测试的性别任务配置中,DAS 在四类路径中的三类里,有 90–95% 的成功案例是通过植入路径实现的;在 SVA 上,它基本忽略这些路径。下游流形内惩罚在测试的性别任务运行中,将不受限 DAS 中由路径主导的成功案例比例降至 5% 以下,但成功率因此下降 6–11 个百分点;受限 DAS 仍然容易受到这类路径影响。
对于新的干预研究,可借鉴的操作是将行为成功与下游因果测试结合起来,而不能只依赖位置距离分数:在可行时构造路径开启与关闭时都保持沉默的对照,施加钳制,并有意纳入各单元本身都处于范围内的组合。这是一项研究设计建议,并不保证 HPC 能检测到每一种捷径。
应谨慎限定结论范围。报告结果来自 GPT-2 small 和两项植入路径基准任务;HPC 的实现未覆盖由注意力介导的路径或非最终位置。在未经修改的 GPT-2 中,成功干预很少表现出单元级别的下游分布外活动,但这一检查无法排除范围内组合,也无法确定这种现象在更大型模型中的普遍程度。下游自我修复可能使钳制后的 logit 差值无法准确估计原本会损失的决策边际。
读这篇论文,可以了解如何检验一次成功的激活干预是否依赖隐藏的下游路径,以及当组合路径中的各单元都处于范围内时,这项测试会在哪里失效。
当坐标任务的答案必须依赖视觉证据时,多模态强化学习学会了依赖图像进行发现
Same Reward, Different Skills: When Multimodal RL Learns to Look
本文针对一个具体的诊断局限:基准表现提升本身并不能证明模型学会了使用视觉证据。在 Geometry3K 上,未使用视觉信息训练的 Qwen2.5-VL-3B,在测试时恢复真实图像后仍有提升:None 条件恢复了 0.137 的增益,Gray 条件为 0.125,而 Real 条件为 0.238。作者直接指出了由此产生的差距:提示中有图像,并不意味着图像进入了学习信号。
作者提出的设计原则是视觉可解析性:让正确作答必须依赖预期的视觉操作,同时确保问题仍然可学习。他们通过反事实坐标场景实现这一原则:问题保持不变,但与答案相关的视觉事实发生变化;在发现设置中,目标绝不会被直接点明。标准 GRPO 使用正确性与格式奖励,并通过留出场景和独立构造的落地配对,检验学到的行为是否依赖视觉信息,以及能否迁移到训练语料之外。
关键结果针对特定操作。在符合条件的留出确认场景中,每个场景含 20 个点,发现准确率从训练前的 0.425 提高到第 30 步的 0.740,以及第 100 步的 0.875。在匹配的第 30 步比较中,真实图像训练在确认性发现任务上的表现优于灰色画布训练,四个随机种子的平均差异为 0.354。灰色图像训练运行获得的正确性奖励很少,因此这一比较并未匹配有效正确性反馈的强度。在构造场景上的训练还迁移到了独立构建的坐标落地任务,使第 100 步的配对准确率提高了 0.180。相反,即使奖励高且训练预算相同,只要通过描述文字就能获得答案,发现能力的习得仍会大幅减少。
值得借鉴的实际操作是将三项测试分开:评分表现是否提升、测试时是否依赖图像,以及训练期间是否从图像中习得能力。使用会改变答案的图像配对,改变提示中可用的捷径,并加入匹配的盲图像对照;随后报告该对照是否获得了相当的正确性反馈。证据仍有边界:主要的能力习得干预使用合成坐标场景,对自然图像和其他视觉格式的泛化尚未经过测试。混合比例的剂量—反应证据也仅在每种混合条件下运行一次,因此这些比较无法证明种子层面的稳健性。
本文有助于设计多模态强化学习评估:它将模型“使用视觉”的笼统说法拆分为可分别检验的视觉必要性、训练期间对图像的依赖、捷径可用性和迁移能力。
Version 1; abstract and sections listed in the evidence map
本期按 2026-10-05 的候选论文事后编制,核验日期为 2026-10-05。
