2026-09-17
2026-09-17
Traverse 在长时程代理运行中基准测试首次失误定位
Locating Hidden Failures Makes Long-Horizon Agents More Reliable
终端任务成功可能掩盖早前的错误:论文指出,一个运行在出现错误后仍可能继续并看似正确。Rahman 等人因此将首次失误定位——而非仅仅最终结果评分——作为长时程监督的操作性目标。
Traverse 包含 1,423 条代理轨迹和 44,341 步,每一步都被标注为正确或不正确,并且手工标注了每个失败运行的第一次错误。其轨迹长度为 20–200 步,涵盖软件工程、计算机使用和科学领域。注释是实质性的方法改变:它将不透明的通过/未通过轨迹转换为序列级别的监督问题。
对于 Scout 的监督,作者向 Gemini-3 Flash 提供每条轨迹的步骤和金标标签,并提示其撰写逐步的链式思考分析以评判每一步。他们随后使用这些分析对 Qwen3-4B-Thinking 进行 SFT,并应用带有按步乘积召回和轨迹级别裁决组合奖励的 GRPO。这样训练出一个以定位首次错误为目标的验证器,而不是假设通用的结果奖励能够解释错误发生的原因。
报告的行为动机支持该目标。在首次错误之后,代理仅在 30.5% 的运行中恢复,并且在 38.5% 的运行中根本未检测到该错误;尽管如此代理仍继续行动。六位前沿评判器也表现困难:在软件工程运行上最强者实现了 26.8% 的精确定位,在计算机使用运行上为 32.3%,且没有任何评判器在任一类别上超过三分之一。安全审计还标记了 65 个不安全动作;论文报告称所有这些动作都是不必要的,97% 缺乏风险承认,且 75% 是不可逆的。
与 ToolPRMBench 的 984 个步级样本和二元奖励的 ToolPRM-GRPO 平均 78.6% 相比,Traverse 将目标改为长轨迹上的首次错误定位;由于任务和轨迹范式不同,所报告的得分不可直接比较。
可迁移的操作是:在为最终成功优化验证器之前先标注首次错误;分别评估定位、恢复和不安全动作,然后测试验证器排序的候选运行是否改善结果。一次干净的复现应消融条件化标签的合成分析并在相同分割上比较复合 GRPO 奖励与二元奖励。这些是建议的实验,而非此处既定的结果。
证据有明确边界。细粒度错误类别有噪声:单一细类别的一致性明显更低(Cohen’s κ=0.30),相比于家族、根源与级联或阶段标签。一项研究覆盖三个领域;其模式是否在具身、多模态或多用户设置中成立仍未确定。
阅读以将首次错误定位与终端任务判定进行比较,并提取用于长时程代理评估的具体注释与验证器设计。
[S1.I1.i2]; [S2.SS3.SSS0.Px1.p1]; [S2.SS4.SSS0.Px2.p1]; [S1.p7]; [S1.p9]; Table 1 [S3.T1]; [S1.p3]; [S2.SS2.SSS0.Px3]; [S4.p3] · S3.SS4.p1; S4.T2; S4.SS2.SSS0.Px1
SAFE 在四种前沿模型中识别出不同的可选证据检查策略
Do Frontier Models Seek Safety Evidence Before Acting?
部署前的决策
SAFE 研究模型在行动前是否选择获取与安全相关的证据。其受控环境在检索成本、声明的概率、严重性和呈现方式上做了变化;在阶段 1,模型选择 INSPECT 或 SKIP。所提供的协议描述了跨五个领域的 900 个环境,每个场景对 GPT-5.5、o3、Claude Opus 4.8 和 Claude Sonnet 4.6 进行了五次独立回放。检查在下游部署选择之前揭示出一个确定性的、与严重性对齐的发现。这将获取安全信息的意愿与在已知该信息后的反应区分开来。 [§3.1–3.2]
在 Offered Report 条件下结果在模型间有显著差异。Opus 4.8 在 96.3% 的回放中进行了检查,而 Sonnet 4.6 和 GPT-5.5 分别在 72.3% 和 68.4% 的回放中进行了检查;o3 在 48.3% 中检查,是唯一在大多数情况下选择跳过的模型。检查随严重性上升,但声明的可能性信号影响较小:将可能性从 10% 提高到 70%,对 GPT-5.5 的检查率改变了 14 个点,对 Sonnet 4.6 改变了 21 个点,对 o3 改变了 13 个点;o3 在 70% 时的检查倾向甚至比在 40% 时略低。这些数字是针对 Offered Report 环境报告的,而非关于开放式部署行为的证据。 [§4]
理由分析补充了一个有用的测量警告。一个经人类标注者验证的自动监测器将期望值推理分类为四个模型中 92–100% 的检查理由和 99–100% 的跳过理由。然而作者的反事实分析得出结论:理由可能遗漏会改变行为的变量,同时强调对行为影响很小的变量。因此,生成的解释应与行为性编辑一并评估,而不应被视为解释决策改变的充分说明。 [Appendix A.1; §6]
可迁移的研究操作是将信息获取设为安全评估中的显式动作,按因素法变换其成本和可用证据的属性,并在有针对性的编辑后比较决策翻转与理由承认。下一个问题是当模型必须自主搜索证据时相同的陈述与行为差距是否依然存在:SAFE 衡量可观察到的决策和生成的理由,而非潜在动机,并研究在风格化单回合设置中的提示式证据获取。 [§7.1]
阅读以借鉴一个具体的检查或跳过评估范式,用以区分模型是否主动获取安全证据与在获得证据后如何行动,同时明确解释可信度和单回合设置的限制。
Abstract; §3.1–3.2; §4; §6; §7.1; Appendix A.1
XConf(体验性置信):与模型累积经验一起估计置信度
Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
设计变更
论文针对置信估计的一个特定限制:现有估计器“只读取当前推理过程”,无论是通过内省、标记概率还是重采样。XConf 则保留先前情节的分级记录。每条记录包含任务、模型在评分前的反思与声明置信、结果,以及在分数到来后撰写的教训。
在推理时,该方法对历史有两种读取。Recall 检索在类似任务中以相似声明置信遇到的过去情节,并读取它们的历史成功率。然后 Reflect 将检索到的记录与当前反思呈现给模型,要求其识别重复的失败模式并重申其置信。作者将该估计器描述为格式通用、无 logit 访问或权重更新,并只需一次答案生成;他们的成本描述还包括一次简短的 Reflect 调用。
报告的评估显示了什么
在推理、编码、多模态问答和交互代理的九个基准以及三个家族的四个模型上,作者使用五折的样本外检索,使得库中包含较早折的情节。在该协议下,XConf 在 24 项比较中有 23 项在判别(AUROC)上击败或匹配十样本自洽法,并且具有更低的校准误差(ECE),生成成本仅为其十分之一。所报告的校准改进因此是与一个生成成本显著更高的采样基线比较得出的,而不是证明 XConf 在所有估计器或任务类型上都占优。
对于部署决策,选择性预测结果尤其具体:按 XConf 置信对情节排序并对置信度最低的 10% 放弃,在代理任务上将交付成功率提高了最多 8.7 个点。作者还报告了对照分析:打乱存储的结果会破坏估计,隐藏结果会抑制收益,增大库规模会改善校准;这些证据表明存储的结果记录,而不仅仅是更长的 prompt,提供了所报告的信号。
一个可迁移的实验
一个编辑上有用的原型是为一个目标工作流建立一个小型分级情节库。比较统计 Recall 得分与 Recall 加 Reflect,然后在时间上保留的情节上评估 AUROC、ECE 以及被接受情况中的成功率。关键问题是:在控制了任务相似度和模型原始声明置信后,检索到的历史结果是否仍然有帮助。不要假定该方法在所有情况下都优越:在可投票的事实回忆任务上,投票法仍保有优势,且作者在主表中报告了一个此类单元格的劣势。
阅读以提取一个具体的检索加反思的置信设计,包括样本外评估设置和在某些边界情形下采样仍占优的说明。
Abstract; §5.1; Table 3; §5.4; §5.5; §7
DRAG:一种用于选择检索器—生成器配置的查询自适应框架
One Size Does Not Fit All! Dynamic Retriever and Generator Selection for RAG
固定流水线的限制
RAG 系统“通常在查询间采用固定的检索器与生成器配置”,尽管查询复杂性和信息需求各异;摘要将此做法与计算资源分配效率低下联系起来。论文还指出检索与生成的自适应性已各自被研究,而它们对端到端 RAG 性能的联合影响仍未充分探讨。 [arxiv:2609.17709v1, Abstract]
路由变更
DRAG 自适应地选择检索器—生成器配置。其无训练的 DRAG_QPP 路由器使用查询性能预测(Query Performance Prediction)信号指导检索器选择,并使用检索到的上下文上的困惑度度量来指导生成器选择。DRAG_SFT 则微调 LLM 以联合预测检索器—生成器配置。报告的分析覆盖了事实型与多跳问答,包括桥接与组合推理任务,跨越三个 LLM 家族和四个问答基准。 [arxiv:2609.17709v1, Abstract; §6.1]
报告的证据说明了什么
在该设置下,作者报告更强的检索通常带来比增加生成努力更大的增益,但两者都表现出递减和非单调的回报。因此在这些实验中,更高复杂度的配置并非对所有查询均一律更好。 [arxiv:2609.17709v1, §6.1]
摘要报告称 DRAG_QPP 在各评估家族与基准上实现了与强静态 RAG 基线可比的性能,同时大幅降低了推理延迟。对于监督变体,作者报告 DRAG_SFT 相对于 DRAG_QPP 在各数据集上通常将下游性能提高约 2–12%,但将延迟提高约 5–40%。 [arxiv:2609.17709v1, Abstract; §6.2]
边界与可复用操作
无训练方法有直接约束:其有效性“在很大程度上依赖于数据特定的阈值选择和生成复杂度的顺序估计”。此外,以效率为导向的 oracle 始终优于自适应方法与基线,显示可达路由决策与 oracle 选择之间存在差距。 [arxiv:2609.17709v1, §4.2; §6.2]
用于扩展的做法是:在训练路由器之前构建一个针对检索器—生成器对的效率感知 oracle。然后询问路由信号是否在无需对每个数据集调阈的情况下缩小 oracle 差距,并同时报告有效性与每查询延迟。这将“使用更强模型”转化为可测量的分配问题:对这个查询应分配哪种检索与生成预算?
阅读以获取一个具体的联合路由设计——无训练的 QPP 加上下文困惑度或监督的联合预测——以及揭示每查询 RAG 资源分配难题的 oracle 差距评估方法。
OBC-Prune 使用因果回放加权来重新校准一次性剪枝
OBC-Prune: Outcome-Based Calibration for Large Reasoning Model Pruning
校准统计量变为结果感知
一次性剪枝推理模型存在一个特定的校准限制:自生成的链式思考比通用数据更能代表推理,但将所有推理标记一视同仁可能会同样保留与错误计算相关的权重与与正确计算相关的权重。RAC 通过向现有剪枝流程添加在线链式思考激活来解决分布不匹配,而 SSGR 则选择更难、适中长度的正确轨迹。OBC-Prune 改变的是校准目标而非剪枝解算器。
其流水线对每个问题以温度 0.8 采样 16 个回放,保留至少有一个正确与一个错误回放的问题直到获得 128 对,并将每个回放划分为推理句子。对于每个句子,它抑制对该句子的未来标记注意力并测量由此导致的下游 KL 散度。这些句子级的因果分数成为逐标记权重:在正确回放中因果重要的标记被上调权重,而在错误回放中因果重要的标记被下调权重。然后将加权激活替换为 SparseGPT、Wanda 或 ALPS 常用的校准统计量;它们的剪枝解算器保持不变。
最强的证据是有条件的但在操作上有用。在 DeepSeek-R1-Distill-Qwen 的 1.5B、7B 和 14B 参数模型上,OBC-Prune 在大多数测试的模型与稀疏率设置中匹配或改进了 C4、RAC 与 SSGR 在 MATH500、LiveCodeBench 和 AIME 2025 上的校准。报告的增益也扩展到 SparseGPT、Wanda 与 ALPS。在作者对 SparseGPT 的分析中,重构保真度在 40% 稀疏度下测量,而崩溃率与完成长度在 50% 下测量;与基线校准方法相比,OBC-Prune 剪枝后的模型具有更低的隐藏态重构误差、更低的终止崩溃率和更短的平均完成长度。对 1.5B 模型在 40% 稀疏度上的组件消融发现,移除正确回放的上调、错误回放的下调、softmax 归一化或句子级加权都会降低 MATH500 准确率。
可迁移的研究操作是将校准视为干预设计问题:在与 RAC 和 SSGR 相同的回放与标记预算下保持一致,仅替换二阶统计量,并记录准确率、重构误差、完成长度、崩溃、被舍弃的问题数和干预成本。这可检验增益是来自基于结果的因果加权而非额外采样或不同的校准预算。
该方法有明确边界。它舍弃了那些采样回放全部正确或全部错误的问题,因为它需要混合结果。在非常激进的一次性剪枝下,它是延缓而不是消除崩溃;所提供的证据并未确立在迭代剪枝或再训练后能否恢复。
阅读以学习如何将正确/错误推理回放对比转换为与解算器无关的剪枝统计量,然后测试额外的因果测量——而非仅仅更多的校准数据——是否能保留推理行为。
Algorithm 1 (alg1.l3–alg1.l23); §4 (S4.p1, S4.SS1–S4.SS4); §5 (S5.SS0.SSS0.Px3–Px6); Appendix F (A6, Table 6); §5 (S5.SS0.SSS0.Px8) and Appendix D (A4.p1, A4.F4) · S4 (Algorithm 1); S5.SS2.SSS0.Px2.p1.1; S5.SS1.SSS0.Px1.p5; S5.SS2.SSS0.Px1.p1 · S3.SS3.p3; S3.SS4.p3.1; S5.SS2.p1
