2026-09-08
2026-09-08
近平局的 LLM 排名在五个测试基准中有四个出现对组合敏感的顺序逆转
Are Near-Tied LLM Rankings Robust to Family-DIF-Guided Benchmark Recomposition?
论文将近平局的排行榜结果视为一个基准组合问题:当以有原则的方式改变项目权重时,一对项目的顺序是否能保持?其方法使用一种无族标签的谱近似来逼近多维项目反应理论(multidimensional item-response theory),而不是传统的边缘最大似然 MIRT 估计器,以在估计残差的项目-族效应之前去除由响应导出的多维信号。
在所有者不重叠的折叠(owner-disjoint folds)内,某一所有者半部分识别出在不同观测模型族之间具有低残差差异项目功能(low-DIF)的题目。该过程随后选择在源-易度(source-and-easiness)上平衡的低-DIF 锚点,冻结其权重,并将它们应用于另一个所有者半部分。主要比较集中于不同所有者、不同族且完整基准分数相差最多一个百分点的成对条目。与蓝图匹配的随机子测验(在源-易度单元格大小和权重上匹配的随机子测验)为通用子测验变异提供了对照。
总体图景是稳定的:完整基准与冻结的 low-DIF 排名的 Kendall’s τ_b 值在 .900 到 .948 之间。成对的近平局则不那么稳定。在四个基准中,30.9%–47.1% 的合格对在 low-DIF 计分下发生顺序逆转,超过匹配随机中位数 16.9–28.6 个百分点;所有匹配随机比较的 p=.001。WinoGrande 是边界情况:其 low-DIF 与匹配随机的逆转率分别为 33.8% 和 34.7%,超额为 −0.9 个百分点且 p=.689。残差项–族签名也在所有者不重叠的两半中复现,族内中位相关为正且为 ρ=.308–.589,并且高于偶然的前 20% 高-DIF 重叠率。
在 MMLU-Pro、BBH、MMLU 和 HellaSwag 中的正向超额逆转模式在所报告的人口扰动下依然存在,包括所有者上限、检查点选择、谱系过滤和留一族变体。没有任何观测模型族在所有基准上显示一致的优势。
因此,一个可迁移的研究操作是对新排行榜进行审计,而不是仅报告其聚合相关性:定义近平局带,在不相交的所有者上构建 low-DIF 权重,把它们应用于保留的所有者,并将成对逆转与与蓝图匹配的随机子测验进行比较。这是一种诊断性重权重方法,而不是证明所选题目普遍更好作为基准的证据。解释仍是有条件的,因为从模型标识符推断的族标签可能会混淆架构、训练、数据和上传者实践。谱近似是线性的,可能会在残差中留下非线性、更高维或未测量的能力差异,因此残差 DIF 并不能确立语义或因果机制。证据还仅涵盖来自单一响应集合的五个静态基准;MMLU 与 MMLU-Pro 共享内容谱系,并非独立复现。
阅读此文以学习一个具体且受控的审计方法,用来判断不到一个百分点的 LLM 排行榜差距在基准重组成下是否存续,同时精确了解该诊断在何处支持或不支持解释。
仅靠评分准则的探针在 LLM 作为评判者的标签中发现可恢复信号
论文检验是否可以仅从评分准则文本(而不见候选响应)预测 LLM 作为评判者的裁决。对于基于评分准则的基准来说,这是一个具体的审计问题。HealthBench 使用 48,562 条由医生撰写的、示例特定的评分准则。其基于模型的评分器仅在 34 项一致性准则上进行了元评估,因此所提供的先验证据并不能验证评分器在所有示例特定准则上的可靠性。
作者训练了仅以评分准则文本为输入、以二元 LLM-judge 标签为目标的分类器。主要探针使用 PubMedBERT,同时比较 TF-IDF 分类器、朴素贝叶斯、BERT、RoBERTa 和 DeBERTa-v3。实验覆盖 HealthBench-Eval-Probe、HealthBench-Hard-Probe 和 ResearchRubrics,采用 80/20 划分、五折交叉验证和 10,000 次自助法重采样。经校正数据集不平衡后,纯准则分类器的输出超过 0.5,并在某些情况下超过 0.8。在 ResearchRubrics 上也出现了类似模式,表明该信号并不限于医疗领域。
论文随后考察了评分准则信号包含的内容。在 HealthBench 的变体中,”fail”、”pass” 和 “not” 在被标记为 0 的准则中出现得更频繁;标记为 0 的准则平均更长;BERTopic 也显示出与类别相关的主题差异。这些观察将措辞视为评估流水线中可审计的一部分,而不仅仅是指令的容器。
研究还使用了反事实扰动:在重新评估前分别对候选响应和评分准则进行反转。报告的结果是,当候选响应或评分准则被反转时,评判者经常无法可靠地更新其决策。对于新的评估者,一个有用的研究操作因此是先运行仅准则探针,然后进行成对的响应与准则反转,并衡量裁决是否按预期方向变化。
边界很重要。由于探针有意隔离了评分准则文本,阳性结果表明存在可恢复的基于准则的先验,而非端到端评判器失败的证明。作者还依赖于二元表述和有限的探测方法集合,这可能低估或扭曲更细微的效应;这些发现可能无法推广到其他领域、评分准则风格或语言。因此他们的解释更多是一项方法学建议:基准构建者应尝试消除可恢复的评分准则先验,并在把自动评分视为对响应敏感的测量之前验证评分准则设计。
阅读此文以学习一项具体的两阶段审计——先作仅准则预测探针,继而进行响应与准则的反事实对比——用于在依赖自动评估器前检测评分工件。
[S4.SS2.p1]; Appendix C Table 2 (A3.T2); [A6.SS1.p2]; [A6.SS2.p1]; [A6.SS3.p2]; [S1.p3]; Abstract; [S7.p1]; [S6.p1] · abstract1.1; S3.p2.1; S1.p5.1; S9.SS0.SSS0.Px1.p1; S8.SS1.p1
高 NAVSIM 得分并不要求规划器对当前交通场景作出反应
端到端的驾驶得分常被解读为规划器理解其当前所见场景的证据。本文通过直接的信息干预来检验该推断:”我们移除模型的摄像头输入,并用在同一地点的先前行驶记忆替换它。”这些记忆可以保留持久的、位置条件化的信息,而被评估场景的当前交通状态则不可被观察到。
所实现的方法 MemoryDrivoR 使用一个基于位姿索引的已编码先前摄像帧库。在测试时,它在 20 m 范围内检索最多 10 条附近记忆,表示它们的相对位姿,使用可学习的 Transformer 重采样器将 64 个寄存器标记压缩为 8 个记忆标记,并把这些标记提供给基于 DrivoR 的规划器。报告的 NAVSIMv1 设置保留 ego-status 输入,从 DrivoR 权重初始化,并在移除当前场景摄像头输入后微调五个训练周期。
在这些条件下,MemoryDrivoR 在 NAVSIMv1 上报告的 PDMS 为 91.1。作者因此指出该结果表明高 NAVSIM 得分不必然要求对当前交通作出反应,并应谨慎解读。这是一个诊断性结果,而不是声称规划器能安全处理任意当前场景:检索设置使得静态场景结构和位置条件性规则可以从早先的遍历中获得。
在所报告的闭环设置中,同样的干预不够充分。在 Bench2Drive(在 12 个城镇的 220 条路线上评估)上,MemoryDrivoR 报告的成功率为 9.5,驾驶得分为 34.7。论文将 Bench2Drive 和 RealEngine 上的更大降幅描述为依赖于基准差异。论文还报告重采样器学会过滤可能分散规划器注意力的过时动态信息;这与内存表示旨在保留有用的持久信息而非陈旧参与者状态一致。
可迁移的研究操作是对基准分数旨在展示的“特定信息”做消融。对于一个具身基准,构建一个基线:保留合理的静态先验和查询时刻的状态,但扣留当前观测;然后询问保留的得分在交互密集的闭环测试中是否依然成立。消融后仍然强的得分并不能单独证明在线感知是其来源。
该协议有明确的限制。它假定对相同位置的重复遍历以及遍历间准确的相对位姿,并且作者明确表示这并不确立自车状态和静态信息能支持的极限。
学习一个具体的信息消融设计,用以检验具身基准得分是否反映在线感知或静态、位置条件化的先验。
即便保持准确性,INT4 KV-缓存压缩也会削弱证据可靠性
Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation
被审计的限制
论文针对一个具体的评估缺口:被压缩的 RAG 答案可能在保留 containment-EM 的同时丧失来自检索证据的支持。其核心结论是,EM 和 F1 单独不能验证被压缩的 RAG,因为表面准确性无法暴露所有的立证回退(grounding regression)。
受控改变
审计隔离了缓存精度,而不改变检索到的上下文或生成程序。对于每个查询,系统从系统提示和前 K 个检索到的文本块构建一个统一的 prefill 缓存,将其以 BF16、INT8 或 INT4 存储,并在相同上下文和解码设置下比较输出。报告的设置使用 Qwen2.5-7B-Instruct 在 RGB 和 HotpotQA 上测试,K 在 {1, 3, 5} 中。准确性以 containment-EM 和 token F1 衡量;证据可靠性以 HHEM-2.1、DeBERTa-v3 NLI 蕴含判定和 Claude Haiku 4.5 LLM 评判器评估。
这种配对设计很重要:BF16 缓存的往返复现了所有 50 个验证示例上的常规全上下文基线,误差在浮点容差范围内。因此量化条件有一个特定的比较目标,而不是未验证的缓存实现。
决定性证据
INT8 在准确性与证据可靠性上均接近 BF16 基线。INT4 则暴露出更具后果性的失败模式。在那些 BF16 与 INT4 之间 containment-EM 未变化的示例中,LLM 评判器在 RGB 上记录了 231 起证据可靠性恶化对 24 起改善的比值,在 HotpotQA 上为 173 对 31。因此,在本实验中未改变的答案准确性并不保证证据支持不变。
论文还报告在更困难的检索设置下 INT4 的退化更明显,包括更多文本块和更多干扰段落。检索深度趋势是有方向性的但统计上不稳健:仅测试了 K = 1、3、5,斜率检验统计量不足(p = 0.12)。INT4 还在 K = 5 时产生了空输出或循环输出——在 RGB 上为 6%,在 HotpotQA 上为 3%——而 BF16 与 INT8 则没有此类问题。
可迁移的操作与边界
对于离线 RAG 部署,复现此配对审计:固定检索文本、提示与解码;将候选缓存格式与未量化参考进行比较;报告准确性与多重证据可靠性信号;然后按检索深度、干扰比例、拒绝率和退化生成分层报告。把该协议视为一种测量操作,而不是证明 INT4 在其他地方会完全相同地失败。本研究覆盖一个模型家族、两个 QA 基准与三个检索深度。HotpotQA 还存在一个低 K 的拒绝校准混淆,因此 HHEM 与 NLI 在该基准上可靠性较差,作者主要依赖 LLM 评判器。
阅读此文以学习如何通过配对缓存精度审计揭示在 EM 或 F1 未变的情况下仍会漏报的立证回退。
S5.p2–p3; S6.p1; Sx1.p1; A1.SS1; A1.SS5
良性查询似然重放能推断出具代理能力的 AI 系统中的隐藏上下文
Context Inference Attacks Without Jailbreaks
先前的隐私分析强调会导致直接泄露的越狱攻击;本文识别出一个具体盲点:摘要指出先前工作“在具代理性的设置中在很大程度上被忽视,而在此设置中上下文由代理自身的工具调用组装。”相关的威胁是成员资格或上下文识别,而不一定是逐字提取。
该攻击将每个可能的隐藏上下文视为一个假设。它收集对良性、与目标无关查询的响应,为每个候选重建评分上下文,计算逐标记的负对数似然,将其在查询和填充抽样间聚合,并选择得分最低的假设。灰盒评分使用目标模型;黑盒评分使用替代模型。论文将该重放程序应用于已知上下文、未知上下文以及通过代理自身工具调用检索到的上下文。
| 决定性的已知上下文结果是在小候选集上 100% 的攻击成功率,在 1,024 个候选处为 63%,而随机基线为 1/ | Z | 。在代理检索设置中,在过滤掉无信息查询后,攻击在一个被测代理上达到 81.8 AUROC。这些结果关涉从普通响应中推断,而不是要求披露记录。它们也与旨在防止直接披露的控制措施兼容:论文报告拒绝指令与 logits 抑制将过度的响应—目标重叠保持在低于 0.0021 BLEU 的水平“同时攻击仍能照常进行”。 |
复制的边界很重要。作者声明黑盒结果“依赖于一个其似然能以与目标相似顺序对假设排序的替代模型”,并报告该条件在模型家族内成立;此条件不应被默示地推广到任意部署模型。他们还警告:“若干设置是为隔离该机制而构建的。”因此候选集、成员先验、检索列表与凭证令牌都是实验控制,而非证明所报道率会不变地迁移到每一部署环境。
一个有用的研究操作是为敏感检索工作负载构建一个小候选集,仅发出良性查询,并在真实候选上下文下比较重放得分。报告 AUROC 或恢复率相对于其随机基线,同时改变候选集大小、查询预算、上下文大小与替代模型家族。可迁移的问题是:防御是否仅降低响应重叠,还是也能使可疑的隐藏上下文假设之间的似然值均衡化。
阅读此文以学习当直接披露检查似乎通过时,如何用良性查询测试隐藏上下文隐私。
abstract1.1; S5.p1; S6.SS2; S6.SS4; S7.p1; S8.p1
本期按 2026-09-08 的候选论文事后编制,核验日期为 2026-09-16。
