零通过的代理任务在声称困难之前需要裁定
审计内容
一个全失败结果本身并不自明。相同的零通过率可以反映真实的能力缺口、缺失的上下文、损坏的参考解、基础设施故障或验证器绕过。论文的具体警告是,缺乏饱和度与真实困难并非同一回事。
作者在一个冻结的 Terminal-Bench 3 / Frontier-Bench 0.1 生产记录上检查了这一区别,该记录包含 1,081 个 pull request、639 个评分任务、28,801 次尝试和 $105,933 的记录代理支出。对于 125 个没有诚实通过的任务,他们结合任务工件、参考解运行、空解控制、对抗试验、轨迹、遥测和审查记录,然后应用有序有效性筛查。由此得到的标签是故意狭义的:经认证未解候选项需满足观察到的作者路线通过、基础设施并未主导失败、未观察到严格的验证器绕过,且所有评估过的代理均失败。
这些计数改变了“零”的解释。在 125 个全失败任务中,78 个满足该经认证未解的条件。其余 47 个被划分为 14 个损坏的 oracle 任务、8 个受限于基础设施的任务、4 个仅通过利用手段可解的任务,以及 21 个可解性未被现有证据认证的任务。这些类别并不确立内在难度;它们仅标识存档证据所支持的内容。
论文还为那些确有诚实通过的任务提供了分级信号。在 346 个此类任务中,为获得第一个存档通过所需的最小记录输出标记将更广泛的真实困难候选与可处理任务区分开来,在此快照中的 AUC=0.750 (95% CI [0.700, 0.801])。这是一个成本信号,而非能力困难的证明。
对于基准维护者,可移植的操作是将零通过事件作为审计触发器:在保存 oracle 与参考运行的同时保留空解和对抗控制、基础设施遥测、轨迹和审查记录;然后报告经证据限定的类别,而不是仅报告通过率。论文自身的警示应随该标签一起保留:78 个经认证未解候选中有 53 个仅有一次记录的参考运行。标签并非决定性证明,运行证据是观察性的而非完全交叉的实验,且所有定量结果均属于一处冻结快照。将“经认证未解”视为对证据的存档性声明——在将其作为对模型无能的主张之前请重复 oracle 检查。
阅读此文以学习一个可重用的逐项审计协议:在将零通过代理任务解读为模型失败之前,把它们变成经证据限定的基准记录。
来源位置
对 15 个 ToolUniverse 科学工具的审计报告 91 起无声的智能体–工具失败
Silent Failures in Agent-Tool Interaction: An Audit of ToolUniverse
论文检查了一类任务完成评分可能遗漏的失败:工具调用看似成功,但有某些信息或功能缺失,且没有通知到智能体或用户。它审计了集成在 ToolUniverse 环境中的 15 个科学工具,将 ToolUniverse 视为实验设置而非研究对象本身。
一个有用的基线是 ToolFailBench,它通过 1,000 个单轮任务和四个标签来隔离智能体是否在其最终答案中利用了返回的证据:Tool-Skip、Result-Ignore、Output-Fabrication 和 Unnecessary-Tool-Use。本次审计改变了诊断单元:它追踪失败位置跨越工具、API、包装器和智能体层,使得在最终答案出现之前就能检查遗漏和语义丢失。
方法结合了 LLM 辅助的候选发现、自动化测试、重复的代理执行和人工验证。作者采用了七类分类法:工具限制、完整或部分的 API 缺口、完整或部分的包装器缺口、代理可用性缺口以及代理解释缺口。这将模糊的“调用成功”评估转为关于哪一层接口转换丢失了信息的问题。
在采样的环境内,审计报告了 91 起在 LLM 辅助候选发现与自动化测试后人工验证的失败。Fifty-one 发生在 API 层,25 发生在包装器层。最常见的机制是缺失数据或字段以及在搜索、过滤或排序准则上的不一致。在评估的维度中,完整性受影响最多,有 28 起;排序与相关性有 21 起,结果适当性有 20 起。
作者提出了情境可靠性这一概念:智能体—工具交互是否保持并传达达到预期科学结论所需的信息、限定词、来源、范围与含义。研究中这是一种概念而非已实现的度量。一个可迁移的研究操作是为每次工具调用创建配对测试:在保留请求的同时删除某一字段、改变排序或过滤语义或去掉限定词,然后比较原始响应、包装器输出与最终主张。即便 API 未返回显式错误,也应将不一致视为测试目标。
证据并非覆盖整个生态。作者提醒本研究局限于 ToolUniverse,涵盖 15 个工具而非整体生态,依赖 LLM 辅助的候选生成并仅对子集进行人工验证,且随着 API、包装器、接口与数据的演变情况可能改变。他们还指出无声故障的操作化并非穷尽,因此报告的计数应被视为在该程序下的审计结果,而非发生率估计。
阅读此文以学习一种可复用的方法,检验科学证据是否在每一次工具、API 与包装器转换后仍然保留——而不仅仅是判断调用是否返回成功。
来源位置
Ajar 将基于危害加权的开放权限与攻击成功和效用分开度量
Ajar: Measuring Open Privilege in Agent Defenses
现有的代理安全评分卡通常询问间接提示注入是否成功以及良性任务是否仍有用。论文指出了一个具体的盲点:防御既能在两者上表现良好,同时仍留下未被任何任务需要的读取、删除或传输权限。Ajar 将这种残留权限作为第三个评估轴,而不是从攻击成功或效用中推断出来。
Ajar 附着于现有基准并重用其良性任务、工具模式、参考解与目标状态。对于每个任务,它构造任务不需要的候选工具调用,对候选进行标注,并在智能体可能采取行动的每个点向防御呈现这些候选。在 AgentDojo v1.2.2 上,这产生了 10,471 个测试,来自 3,551 个独特的 (task, tool, arguments) 候选,跨越决策点 k=0 到 k=18。其主要得分——过度特权泄漏(OPL)——是被标注为 deny 的过度调用中被防御允许的按危害加权比例;加权使得代价高的错误比等权重大得多。
在对 Progent、CaMeL、AC4A、Permission Assistant 与 Claude Code Auto 的报告比较中,OPL 在防御之间以无法从攻击成功或良性效用单独恢复的方式表现出差异。一个具体比较是,两个 OPL 相差小于 0.009 的防御在良性任务完成率上仍相差 37 个百分点。将决定模型从 Sonnet-5 换成 Haiku-4.5 也会可测地改变同一防御与包装器的 OPL 与充分性。
可移植的研究操作是将现有的良性任务基准转为防御测试:从其任务工件生成过度调用候选,在动作点暴露每个候选,并报告泄漏与是否拒绝必需调用。然后在更改单一防御组件(例如决定模型)时重新运行套件,以区分包装器与组件效应。要带着的问题不是简单地“攻击是否成功?”,而是“在何种标签、模型与集成下,该防御会允许哪些不必要的调用?”。
边界很重要。AgentDojo 对 10,471 个标注中验证了 2,822 个;73% 是由 Ajar 的 oracle 规则断言的。候选生成采样了一个大空间,因此 OPL 估计的是采样覆盖而非穷尽的权限。Ajar 对每次调用给出一个定点的允许/拒绝决定;它不对随后可能的多步检查建模,也不证明部署安全。将 OPL 视为一个测量层,其置信度取决于 oracle 质量、采样、包装器集成与决定模型的方差——而非独立的安全保证。
学习如何将现有良性任务基准转化为抽样的、按危害加权的不必要允许调用测试——并在重用该度量前审计 oracle 与集成限制。
来源位置
TwinCheck 将 GPT-5.6 在 159 个精确重放 BFCL V4 任务上的 Sol 成功率从 45.3% 提高到 58.5%
TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents
为什么阅读这篇论文
论文将一个局部可行的工具调用视为可能破坏原本成功的有状态智能体轨迹的因素。CRITIC 提供了一个具体的先验限制:其消融实验发现仅用 LLM 自身生成批评、而不利用外部工具反馈,会带来边际或负收益。TwinCheck 的回应是将替换本身作为验证对象,而不是把怀疑当作充分的修正理由。
有何变化
TwinCheck 仅在轨迹满足与轨迹局部失败假设相关的证据条件时尝试修复。它构造一个以轨迹为基础的反事实替代——“负向双胞胎”,然后对候选项做结构性检查,并让一对比对验证器在两种候选顺序下比较执行者与双胞胎。仅当双胞胎通过这些检查并在两种顺序中都获胜时才接受替换。在成对评估中,精确重放在第一次接受的替换之前将智能体的解析响应与动作固定,从而将干预效应与执行者重采样区分开来。
决定性证据
在包含 159 个具有完整精确重放成对的多轮 BFCL V4 任务的主要分析中,完整策略将 GPT-5.6 在 Sol 任务上的成功率从 45.3% 提高到 58.5%(13.2 个百分点;95% task-bootstrap CI [8.2, 18.8]);作者未观察到由成功变为失败的回退。成对比较中记录了 21 次救援与 0 次观察到的伤害,McNemar p=9.54×10^-7。一个已完成的主要敏感性集合显示了预期的选择性:冻结门在 88 个执行者失败中选择了 39 个,而在 72 个执行者成功中未选择任何一个,精确率为 1.000,召回率为 0.443。
在小规模复现中,应记录触发证书、原始动作、双胞胎、每次结构性拒绝、两种验证器顺序以及替换后的结果。报告救援与伤害的转变——而不仅是总体成功率——并改变替换阈值及执行者/验证器模型的分离;这可测试所报告的精确率是否在冻结运行点与共享模型族之外仍然成立。
边界
证据范围有限:评估覆盖来自四类 BFCL V4 多轮任务的存储轨迹,且仅在一个执行者模型下进行。对每个任务仅使用一个存储轨迹的精确重放并不能估计对模型/API 重采样的鲁棒性,而且共享模型族可能使执行者与验证器错误相关。作者还警告说 TwinCheck 并不构成在具重大后果情境下自主行动的授权。
阅读此文以提取一个具体的高精度干预协议:在判定替换前约束轨迹局部替代,然后在精确重放下评估救援与伤害转变。
来源位置
LeakScale 估计受控基准暴露对可执行准确率的影响
Beyond Overlap: Estimating the Causal Effect of Benchmark Exposure
基准重叠或出处可以证明评估材料进入了训练集,但无法揭示材料对评估影响了多少。LeakScale 通过对可执行任务的受控干预来填补这一缺失反事实。
该工具为每个新的可执行任务配对一个家族特定的私有键值关联,该关联在公共任务中不存在且不可推导。评估前,隐藏的夹具对该关联进行认证:恰有一个候选产生完美的可执行行为,而每个错误候选至少在 25% 的夹具上失败。家族被分配到目标暴露条件(C2)或无密钥对照(C0)。暴露通过 one-epoch LoRA 适配器训练实现。适配后的模型与其基态一起被测量,估计量通过一个二组二态的差异中之差对比,将 C0 的适配广义变化从 C2 的变化中相减。
决定性结果不仅在于暴露带来提升。跨越 2,048 个独特家族、两个模型家族、两个可执行域与 262,144 次生成,受控暴露在每一个模型-域单元中都提高了估计的可执行准确率,增益范围为 +7.17 到 +27.31 个百分点。在一个具体单元——Qwen3-4B-Instruct-2507 的 Python 域——估计为 +27.31 个百分点(95% CI [+22.86, +31.75]);该计算使用了 512 个 C2 家族与 512 个 C0 家族,每个家族每个状态抽取 32 次。此结果使得论文的操作区分具有实用价值:审计可以分别报告接触的证据与可归因于特定暴露机制的分数变化。
一项实用的研究操作如下。构建一小组可执行任务,隐藏一个必要变量,用隐藏夹具认证正确性,并保留同时期的无暴露对照。然后报告差异中之差估计——而不仅仅是适配后的分数——并在不同域或模型家族上重复该干预。将所得数值视为有条件的:每个模型-域单元使用了一个适配器训练实现,且家族聚类自助法并不捕获训练种子的变化。更根本地,这只是对受控的训练后适配器暴露在所构建工具上的估计,而非对有机的网络规模污染或预训练摄取的直接估计。
学习如何将基准暴露转化为可测量的分数变化实验:使用私有可执行任务与差异中之差对照,同时明确其训练后范围。