目录
  1. ReliabilityRoute 用可靠性特征对预测机制进行路由
  2. CC-SMCS 将覆盖率约束的保序模型选择转化为时间一致的置信集推断
  3. RECLAIM 在运行、重训练与重实现层级上测量代理的复现能力
  4. 因果干预将定位识别为视频代理下游错误的主要来源
  5. 替代分词可在开权重 LLM 中绕过局部知识编辑

ReliabilityRoute 用可靠性特征对预测机制进行路由

When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing

预测代理越来越多地将语言模型推理、检索、市场先验和历史类比结合起来,但论文把它们之间的选择视为可观测的行为,而不是隐藏的实现细节。在 ForecastBench-style 的二元任务上,论文报告对于某些数据生成过程结构化类比占主导,而对于另一些则市场/众包式和保守基线更好。

方法更改是 ReliabilityRoute:一个基于规则的路由器,使用历史覆盖、市场先验的可用性与尖锐度、来源先验的尖锐度、证据强度、证据分歧和预测时域来决定哪种机制控制预测。一个固定规则在 2024 标定年样本上拟合;一个自我调整版本从先前已解析的年样本中以滑动前瞻方式重新拟合阈值。该规则使用可靠性特征而非硬编码的来源名决定,使其路由轨迹可检验。

在 2025-10-26 的评估年样本上,固定规则在 Brier 指标上达到 0.1846,而 HistoricalAnalog 为 0.1876,且未进行再调参。论文的重要限制是配对自助法区间相对于最强单一基线略有重叠零点,因此在所提供的证据下,这一单一年样本的提升在统计上并不决定性。在 16 个后来由 LLM 撰写的年样本中,自我调整路由器的平均 Brier 为 0.1839,而固定规则为 0.1867,并在 16 个年样本中赢得了 7 个。

负面结果澄清了不应假定的内容。一个按来源拟合的路由器在 2025 年评估上得分为 0.1949,论文将其解释为对标定年样本来源工件的过拟合。Platt 式的全局校准将 Brier 从 0.1846 提高到 0.1882,而基于来源的条件校准则将其提高到 0.2004。涉及复现的多代理基线的比较也并非对外部 AIA Forecaster 系统的忠实复现。

一个后续实验建议记录每个可靠性特征、阈值决策和在解析前的路由;仅使用先前已解析的年样本重新拟合;并同时报告 Brier 与校准误差。论文明确指出,需要嵌套开发切分和外部预测数据集来检验其人工设计规则族是否能泛化。因此可迁移的问题不仅仅是推理是否有帮助,而是哪些可观测的可靠性信号能证明在新年样本上把推理置于控制地位是合理的。

阅读它以学习如何将推理与更简单的预测来源之间的选择转化为一个可审计的、前瞻式的路由实验,同时检测过拟合与校准迁移失败。

来源位置

CC-SMCS 将覆盖率约束的保序模型选择转化为时间一致的置信集推断

Sequential Confidence Sets for Coverage-Constrained Conformal Model Selection

带覆盖率约束的保序拟合(conformal)模型选择的推断目标有别于普通的 argmin 推断:在比较成本之前,流程必须满足被监控的未覆盖率约束。被引用的先前 argmin 论文使用交叉验证的软最小竞争者来推断批量数据中平均最小坐标。其报告的有效性是渐近的,并且对每个真实 argmin 指数是边际的,前提是在 IID 有界观测和稳定性条件 λ_n=o(√n) 下成立。

CC-SMCS 将目标改为自适应保序流程下的约束 argmin。它为每个方法–约束对构建前缀平均条件未覆盖率的同时鞅置信序列,然后将它们的乘积视为矩形置信区域。它报告三类不同输出:经认证可行(certified feasible)、可能可行(possibly feasible)和可能为约束最优(possibly constrained-optimal)的方法。

投影有直接的操作规则:保留某个方法,当且仅当其下界置信区间不会在任何约束下排除可行性,且它的观测成本不大于所有经认证可行方法中观测到的最小成本。基于假设 5.1 中对方法数和约束数为固定的前提、预分配的误差权重、可预测的曝光与成本,以及所述的鞅构造,定理 5.2 给出了有限样本、时间一致的保证:对所有时间同时成立,经认证可行的方法是真正可行的,真实的可行集合包含在可能可行集合中,并且每个约束最优的方法都包含在投影的模型置信集中。该保证声称既不需要平稳性也不需要混合性,并且在数据依赖停止下仍然有效。在持续曝光下,置信半径以报告的阶数 O(√((log t + log(MR/δ))/t)) 收缩。

这一限定很重要:投影集是对约束优化器的外部置信集,而不是事后选择的覆盖契约;它可能包含并非真正可行的方法。在覆盖边界 p=τ 处,论文的二候选伯努利示例表明,均匀的 Oracle 覆盖要求可能将“曾经报告排除另一候选的单点解”的概率限制在最多 δ,即使存在成本更低的候选也如此。

对于新的序贯评估,预先声明约束与成本,在方法–约束对间分配误差,运行置信序列,并决定部署是否需要经认证的可行性或仅对优化器的不确定性。可迁移的研究问题是,当覆盖接近阈值时,区分这些决策需求需要多少证据。

阅读它可以学会在保序模型选择必须满足覆盖率约束时,用时间一致的置信集替代过早的赢家宣告,并理解在覆盖边界处为何安全的单点识别可能失败。

来源位置

RECLAIM 在运行、重训练与重实现层级上测量代理的复现能力

RECLAIM: Can Agents Reproduce the Claims of Machine Learning Papers?

先前基准的边界。 CORE-Bench 有意仅抽取可复现的 CodeOcean 封装。RECLAIM 通过将作者工件可用性作为显式任务变量来改变该边界:它是一个包含 100 篇 NeurIPS 2025 论文的基准,可每年从新的会议中重建。

对于每篇论文,RECLAIM 事先固定要复现的结果、什么算作成功复现,以及一个 GPU-hour 预算。作者发布的内容决定难度等级。Run 级发布包含代码、数据和权重;Retrain 级缺少权重,因此代理需训练模型;Reimplement 级缺少代码,因此代理需自行编写代码。代理必须使用论文与作者发布的任何内容来复现该结果。

一款独立的语言模型会对运行日志和输出而非代理报告进行评分。该自动化 LLM 审核者 Claude Sonnet 5 在复现/未复现判定上与人工评分者的一致性达到 F1=0.82。这使得执行溯源成为基准输出的一部分,而不再仅依赖代理的成功叙述。

在每篇论文各运行一次的四个代理中,每个等级中表现最好的代理仅复现了 41% 的 Run 级论文、27% 的 Retrain 级和 15% 的 Reimplement 级。失败的尝试平均使用了其分配 GPU 小时的 29%。最常见的代理错误是撰写方法实现但未将任何部分与论文的数值核对,发生在 63 次中的 400 次运行中。可操作的教训是,在将剩余预算花在实现或调试之前,要求进行一次早期的数值核查。

边界。 RECLAIM 在其集群上没有人工复现,因此对于 76 次执行了忠实流程但未在容差内通过的运行,它无法将代理错误与随机种子和硬件方差区分开来。论文还报告了污染风险:每个代理都晚于论文发表,可能在其训练中见到过这些论文的代码,记忆化的修复在评分下会被记为复现,从而抬高已发布代码等级的通过率。

研究操作。 对于一项小规模研究,跨三个等级选择论文,为每篇论文预先承诺一个匹配目标和成功标准,设置 GPU-hour 资助,保存日志与输出,并对失败但忠实的流程添加人工重运行。最后的该比较检验未通过是否反映代理问题或普通实验方差,然后再将其归因于代理改进干预。

阅读它以借鉴一个论文级复现协议,该协议将工件可用性与代理表现分离,并保存执行证据以便审计。

来源位置

因果干预将定位识别为视频代理下游错误的主要来源

Beneath the Scores: Rethinking Hallucination Evaluation for Video Understanding Models

视频代理越来越多地构建为将时间定位、视觉观测和推理分离的多阶段系统。论文认为,各阶段独立基准得分并不是一致的诊断信号:某一阶段的高分并不必然意味着下游幻觉或答案错误更少。

其方法用受控的阶段干预替代跨基准的相关分析。在覆盖 2,522 个 CG-Bench 问题、横跨 227 个长视频的数据上,研究在三种视频代理架构中用预言窗或与长度匹配的随机窗覆盖定位阶段,然后测量固定下游任务的变化。在将定位钉在预言窗口时,它还通过省略采样帧或用与证据区至少相隔 60 秒的帧替换来测试视觉观测失败。

决定性的结果是,用真实的时间证据窗口替换等长的随机窗口会使下游准确率提高约 17–18 个百分点,跨三种架构均成立。该效应大约是将证据窗口内严重帧破坏的效应的四倍。已部署的定位器仅恢复了可用的预言—随机准确率差距的大约四分之一,留下一大约 12–13 个点的测量上行空间。

干预设计也改变了“良好定位”应有的含义。将正确的证据窗口扩大到多达约八倍并不会实质性降低准确率,这表明包括正确区域比严格的时间重叠更重要。相反,可疑的偏离帧对准确率的破坏比相应的遗漏更严重。对于评估设计,这更倾向于测试证据是否命中目标以及系统是否能抵抗误导性证据,而不是仅依赖重叠或完整性。

论文在证据层的诊断发现,42–65% 被最终答案准确率标记为正确的答案缺乏充分的视觉证据,同时一些幻觉度量在分布漂移下失去判别能力。其基准审计同样未发现标准基准得分与对定位干预的因果敏感性之间有可检测的关联。

一个可迁移的实验是保持下游问题不变,逐次覆盖一个内部阶段,并报告与受控基线的配对变化。这将“哪个模块失败?”转化为可检验的因果问题。对结果的解释须保持狭义:主要因果分析衡量的是下游答案准确率而非无支持内容的幻觉,系统级相关性具有较大不确定性,且每个代理族仅评估了一个检查点。

使用论文的阶段覆盖协议,检验你自己的视频代理的弱点是否因果地归因于定位、观测或其它阶段。

来源位置

替代分词可在开权重 LLM 中绕过局部知识编辑

The Tokens Remember: When Tokenization Bypasses Knowledge Editing and Unlearning

模型编辑与机器弃学旨在在不从头重训练的情况下修改或移除有针对性的知识。论文指出了两个安全评估缺口:先前的检查通常需要原始的编辑前模型或辅助分类器,而且它们通常只测试输入的规范分词。第二个选择很关键,因为相同字符串可能有替代的有效分词,会导致不同的计算轨迹并可能绕过局部修改。

Toketive 将这些替代分词作为探针,而不是将分词视为无害的预处理。它是一种无参考攻击,直接在已发布模型上运行,无需编辑前模型、训练数据、影子模型或辅助分类器。它利用替代分词检测被修改的事实并重构相应的编辑前响应。一个关键的路由信号是表征纠缠:中间层主体结尾隐藏态之间的余弦相似度;论文报告该信号在测试的数据集和模型上比编辑距离更能预测检索到的规范事实对象。

在五个 LLM、六个数据集和六种编辑/弃学技术的实证中,38.6% 的替代分词绕过了修改并恢复了编辑前响应。检测达到了 F1 84.2%,比最强基线相对提升 26.2%。重构在前 5 命中上达到了 74.5% 的准确率,比最佳基线高 21.7%;该度量统计在报告的多数投票设置下,真实的编辑前对象是否出现在五个最常见的绕过候选中。

该结果受限于攻击的搜索程序:采样器并未穷尽分词空间,因此成功率依赖于其尝试预算和超参数。检测阈值在一个留出 的 Llama3-plus-MEMIT 配置上进行了校准,这使得校准成为复制变量。一个自适应防御实验在四次重复 MEMIT 迭代后将绕过率从 0.32 降到 0.04,但论文报告了显著更大的附带连锁效应。

一个实用的研究操作是取一个被编辑的事实,生成精确字符串的替代分割,记录响应和一个中间隐藏态相似度分数。在将编辑视为安全边界之前,在固定预算下比较绕过率;然后在更大预算下重复,并报告阈值校准如何改变结果。

阅读它可以把分词变体转成一个具体的约 30 分钟审计,用来判断被编辑的事实是否仍被压制,同时明确攻击的开权重与采样预算假设。

来源位置
本期按 2026-09-26 的候选论文事后编制,核验日期为 2026-09-27。