CELLAUDIT 审计模型是否真正使用了所声称的输入,而不只看留出集预测分数
留出集预测分数本身并不能说明模型确实使用了所提供的扰动输入。CELLAUDIT 将这一差距拆解为三项独立检查:所引用的源代码是否允许该输入进入计算;替换该输入后,拟合模型的预测是否改变;以及这种变化是否改善了对观测响应的预测。该方法的关键变化,是将实现、拟合后的依赖关系和与目标相关的贡献视为不同主张,而不是从 PCC 一次性推断出它们。
在 BBBC047 上,一个高分预测器对化合物替换完全不敏感:Fold 5 上其 Global PCC 为 0.3153,对照组仅使用控制变量的预测器为 0.3142,而且配对的“完整模型减控制模型”区间跨过零。对源代码的检查追溯发现,被引用但未生效的化合物通路采用了单例键值注意力;其归一化权重是常数,因此无法通过查询传递化合物信息。依赖关系与收益之间的区别在分层抽样中也有所体现:48 个候选中有 47 个在两个折上都会因替换化合物而改变预测,但只有 20 个在两个折上的目标损失支架区间均为正。
审计结果也推动了模型修订,而不只是事后批评。在 BBBC047 上,由反证引导的残差模型相较仅使用控制变量的基准仍保留了预测增益:完整模型减基准的 Global PCC 增益在 Fold 4 上为 +0.0037,在 Fold 5 上为 +0.0028;同时,平均化合物效应在两个折上均为正,而且预测增量的联合模型支架区间高于零。然而,两个折都未满足预先登记的剂量资格规则,因此这些分析面板不能证明模型使用了剂量信息。
更广泛的反馈结果具有启发性,但并非定论。在匹配的 sci-Plex 搜索中,审计增强型反馈的留出集平均预测表现及化合物/剂量贡献均高于仅依据分数的反馈,但比较仅基于五条配对轨迹,且配对区间跨过零。在独立采集的重新拟合中,剂量使用的支持符合预先登记的标准并得以迁移,而化合物身份的支持则没有迁移,尽管完整模型相对于仅使用控制变量的基线仍有正向预测增益。
对于研究流程,值得借鉴的具体做法是:评估前记录所声称的输入路径和替换分布,然后在冻结检查点上分别报告源代码实现、预测依赖性和目标收益。替换效应仍以预先登记的分布为条件;它们不能证明因果效应或生物学机制。操作层面要问的是:所声称的输入是否改变预测,以及预先登记的替换测试是否显示这种变化改善了观测目标;而不只是 PCC 是否上升。
读这篇论文,可以了解如何在信任智能体发现的模型之前,把一个高分拆解为三项可分别检验的输入使用主张。
来源位置
逐点评分的 LLM 评判基准存在由评判者决定的可靠性上限
Ask Which, Not How Good: Sizing Benchmarks Scored by an LLM
增加基准项目并不总能让由 LLM 评判的比较更有定论。以往针对 LLM 评估的统计规划会对抽样问题的不确定性建模,并可使用问题层面的配对差异。对于由评判者打分的基准,具体局限在于:仅按项目进行规划并不能揭示系统与评判者交互产生的残余误差;在本文的模型下,增加项目无法降低这一部分误差。
该方法改变了测量目标。论文使用 373,019 条评判结果,拟合了一个以系统为测量对象的交叉广义理论模型,将变异分解为系统、项目、评判者及交互作用成分。只有一名评判者时,随着项目数增加,广义性趋近于 σ²_s/(σ²_s + σ²_sj)。由此得到的上限针对的是可靠性——系统比较的可重复性——而不是评分准则是否有效地测量了质量。
估计结果取决于评判者总体和评分协议。对于逐点评分的 MT-Bench,报告的上限为:六名当前一代评判者时为 0.798,纳入全部九名评判者时则为 0.600。在一项匹配的 MT-Bench 比较中,原生协议使系统方差占比接近翻倍,从 4.8% 升至 8.4%,并使估计的单评判者上限从 0.623 升至 0.798。这些是特定封闭评判者面板、基准和评分准则下的估计,并非 MT-Bench 的普遍属性。
成对评分并非简单的解决办法。在另一组平衡展示顺序的成对评分实验中,估计的单评判者上限达到 0.986,bootstrap 区间为 [0.934, 1.000];但平均而言,先展示某个系统会使其胜率提高 8.6 个百分点。作者提醒,该实验使用了他们自己的项目、评判者和固定基线,因此不能直接衡量部署中的 Arena-Hard 或 AlpacaEval 2 流程。
这对评估规模规划有重要启示:在基准原生项目数下,测得的误差下限为 0.41–1.24 分(0–5 分制),而报告的改进中位数为 0.28 分。在论文唯一一项完全匹配的基准比较中,恢复出的 17 项 MT-Bench 改进,在 30 个项目和 MT-Bench 原生的 80 个项目下,均低于估计误差下限。开展新评估时,应先用多个评判者在一个交叉子集上进行试测,估计系统与评判者交互效应及协议效应,并在决定增加项目数或报告小幅增益前计算可检测差异。
边界条件很重要。“可靠性是可信比较的前提,而非其替代品。”经过区分能力筛选的 Sieve 集展示了测量工具设计,但并不代表任务覆盖情况。披露审计的分母也存在尚未解决的矛盾:正文提到 227 篇论文,而表 5 的标题说明为 92 篇。将论文的上限或审计率应用于其他场景时,应同时说明这些限定。
在规划由 LLM 评判的评估规模之前,读这篇论文:它提供了一个具体方法,帮助判断下一笔预算应投入更多项目、更多评判者,还是针对协议偏差的试测。
来源位置
LIMBO 发现,恰好一次保护取决于写入结果是否可观测
收到超时或服务器错误时,一次结果不明的写入可能已经生效:重试可能造成副作用重复,而放弃则可能漏掉必需的工作。
一项已有的相关研究提出,在重试结果不明的操作前检查特定任务的后置条件。其具体局限在于适用范围:证据来自两个带有手工设计验证器的模拟工作流,且未评估真实外部 API。LIMBO 并未将“重试前验证”包装成新方法,而是改变了评估目标:它引入一个确定性沙箱,其中包含六项服务、贴近现实的契约、十二种服务边界故障模式,以及记录已提交副作用的账本。研究跨越九个模型、三个生产级工具框架、两种契约变体和十五种恢复条件,共评估 25,930 个回合。
关键区别在于能否通过即时回读查明发生了什么。对于测试的六个前沿模型,已提交写入但确认信息丢失时的重复率为 0.5%;而延迟提交和重新投递回合的重复率分别为 56% 和 74%。方差分解显示,在回读可判定故障中,契约解释了重复方差的 30%;在回读无法判定时,这一比例为 81%;模型所占比例分别为 53% 和 8%。在重试前已验证的子集中,最终一致性对应的重复率高于强一致性(13.4% 对 0.8%)。
当每次写入都提供密钥且防护逻辑将其附加到写入时,延迟提交导致的重复从 68% 降至 7%,重新投递导致的重复从 74% 降至 0%,而恰好一次成功率达到 99%。论文还证明,对于没有在途时间上界的延迟提交,仅靠验证无法保证恰好一次完成。在测试的重尾延迟条件下,等待一小时使恰好一次成功率达到 84%,每个回合的模拟耗时为 49.9 分钟。
但这些是模拟服务的结果,并非生产环境估计;论文指出,受网关控制的设定、特定时间的模型版本和探索性分析都是局限。等待与密钥之间的具体权衡也取决于所选的延迟分布。对于新的可靠性实验,应先按可观测性对故障分层:在回读能够区分状态时使用验证;在无法区分时,测试契约层面的保证。
读这篇论文,可以判断下一项可靠性实验应该优化验证逻辑,还是增加写入契约保证。
来源位置
RAG 需要进行时间有效性检查,以避免陈旧文档投毒
Stale-Document Poisoning: When Outdated Retrieval Overrides Correct Model Answers
只有当检索到的证据仍然有效时,RAG 才能帮助应对过时知识。本文研究“陈旧文档投毒”:真实且曾经有效的证据,会让模型答错,尽管不检索时模型能给出正确答案。
一个相关的医学基准 MedRevQA 要求模型在没有提供上下文的情况下作答,并将预测与过时标签和最新标签进行比较。这种设计衡量的是模型的内部知识表现,但没有测试检索是否会推翻同一模型最初答对的答案。
作者构建了一个包含 317 个知识反转案例的基准,覆盖医学、法律、软件/API 和平台政策,并以注明日期的官方来源为依据。投毒的计数采用条件式标准:只有模型在不检索时回答正确、随后在收到过时文档后改为错误答案,才记为失败。
关键对照使用了 50 个经核验的反转案例。每组配对中,历史证据、问题、答案选项和指令均保持不变;只有评估日期发生变化。结果区分了日期识别与有效性判断。明确说明有效性边界时,Qwen-72B 完成了全部 50 次从旧信息到当前信息的必要转换;而仅改变日期的转换中,该模型只发生了 50 次中的 7 次变化。在匹配的医学比较中,没有“遵循指令”时,检索过时信息使 Llama 和 Qwen 的答案分别有 30% 和 37% 发生改变;明确要求遵循文档后,这些比例升至 66% 和 75%。
激活补丁实验提供了机制层面的探查:改变评估日期位置的内部状态会改变答案偏好,而在未改变的来源日期位置进行补丁以及自我补丁的影响都微乎其微。作者将这一因果解释限定于受控的答案 logit 任务,并且每个大型模型最多使用 20 个在行为上符合条件的项目;这并不能证明相同组件也支配不受约束的生成或已部署的 RAG 系统。
所提出的缓解方法比问题诊断的适用范围更窄。一种固定的混合重排序器结合语义相似度、文档年份和替代提示;在日期正确时,它将投毒降低了 4.6–10.0 个百分点。日期错误则可能逆转这一收益,因此该干预依赖可靠的时间元数据。
对于新的评估,可以借鉴这种匹配设计:固定证据和问题,只改变评估日期,并比较仅提示日期与明确说明有效性边界的提示。这能直接检验系统究竟只是在遵循检索文本,还是在判断文本是否仍然适用。同时也应报告项目难度方面的局限:论文中已确定与近期医学信息的比较使用了不同问题,因此无法充分区分信息新近程度与问题难度。
读这篇论文,可以借鉴一种受控的 RAG 时间适用性测试:论文区分了服从检索文本与判断证据是否仍然有效,并展示了为什么元数据质量会限制简单的近期性修正。
来源位置
目标错配与随机奖励仍能保留世界模型后训练的部分收益
Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training
下一观测后训练存在一个具体的归因问题:用于奖励预测的优化过程,可能带来学习预测世界之外的其他效应。因此,世界模型训练后任务表现有所提升,本身并不能说明智能体学到了什么。
本文通过受控干预将这一问题转化为实验。研究比较真实的下一观测目标(GT)与来自训练分布、但与当前转移不匹配的真实观测(MIS),同时使两种训练流程保持一致。另设 COIN 条件,用独立随机信号替代基于预测的奖励。评估同时测量留出集预测准确率、pass@1 和 pass@64,随后考察候选动作生成与循环行为。
最明确的结果是预测质量与任务指标之间出现分离。在 ALFWorld GRPO、ScienceWorld GRPO 和 ALFWorld OPSD 中,与 GT 相比,MIS 下的预测准确率下降了 15.3–61.6%;而 pass@1 的绝对差异为 0.51–2.75 个百分点,pass@64 的差异至多为 3.0 个百分点。在这些比较中,目标严重错配与任务表现近乎保持并存;这说明的是在所测试流程下如何进行归因,并不意味着错误目标在任何情况下都与正确目标等效。
随机奖励对照让优化效应这一解释更加具体。在 ALFWorld 的列表设定中,COIN 将 pass@64 从 BASE 的 56.20% 提高到 87.23%,尽管其奖励中不包含任何环境信息。与 COIN 相比,真实奖励对应着更高的单次尝试成功率——pass@1 为 37.30%,而 COIN 为 30.41%;但 COIN 的 64 次尝试覆盖率高于 GT,分别为 87.23% 和 83.94%。包括 COIN 在内的训练也伴随着对更多候选动作的考量,以及相较 BASE 更少的循环行为;这些行为指标并不能证明每个新增候选动作都会提升成功率。
在文本环境之外,结果仅在一个有限测试中得到扩展:在 201 个留出的、只读 VisualWebArena 任务上,COIN 的 pass@64 为 39.80%,BASE 为 34.83%,报告的相对提升为 14.3%;配对精确 McNemar 检验的 p=0.0414。
可复用的研究操作是一项归因审计:固定优化器、数据量和评估方式,只破坏目标对应关系;随后用独立安慰剂替代包含环境信息的奖励。报告单次成功率与多样本覆盖率。解读结果时应保持谨慎:预测准确率由 LLM 评判,正文中的主要文本环境比较未报告多随机种子稳健性,而且网页测试仅覆盖 201 个只读任务。现有证据支持的结论是,在这些实现中,移除目标对应关系或奖励信息后,部分增益仍然存在;而不是环境信息从来没有帮助。
读这篇论文,可以了解一种实用的安慰剂对照设计,用于区分环境信息与优化效应,同时比较单次尝试成功率和多次采样覆盖率。