2026-10-09
2026-10-09
智能体可塑性衡量智能体将经验转化为留出收益的效率
Agent Plasticity: Measuring Self-Improvement Through Experience
大多数智能体评估衡量的是智能体在某个固定时点能做什么,而不是它能多有效地从经验中学习。本文则评估固定权重谱系中的持续自我改进:行动回合从全新情境开始,而不断演化的工具、策略、技能和记忆清单会被后续实例继承。
在每个检查点,作者都会衡量训练交互和留出交互上的表现,同时计入学习成本。他们将智能体可塑性定义为经验转化为未来留出表现收益的效率。这样一来,最终得分和习得效率就成为彼此独立的评估目标:模型最终得分可以最高,却未必是提升效率最高的模型。
报告的表现轨迹说明了这一区别为何重要。在高难度国际象棋中,GPT-5.6 Sol 从接近 0% 上升至后期报告检查点的 36.9%;与此同时,Claude Fable 5 和 Claude Opus 5 的留出绝对得分更高。在综合游戏的饱和估计中,GPT-5.6 Sol 的估计可塑性最高,而 Claude Fable 5 的拟合表现水平最高。论文还将同一难度范围内的收益与向更强对手的迁移区分开来:面对更强留出对手时,收益通常较小或不太稳定。
诊断层是其中具有实际意义的研究思路。在所分析的模型—游戏单元中,留出工件复用更多与留出得分收益更大相关。但高使用率并不足够:在国际象棋失败分析中,对于高复用模型,大多数剩余的已识别失败发生时,相关工件已经处于使用状态。因此,作者将可能的瓶颈归纳为缺少工件、未能复用,或工件虽被复用却在质量、泛化能力或应用方式上无效。
这些诊断应视为描述性结果,而非因果结论。论文没有证明复用会导致收益,也没有将工件质量问题与应用失败区分开来。论文还没有分离环境反馈的价值与反思和工件修订所耗费额外计算资源的价值;可塑性估计取决于得分提升空间、学习时长、饱和拟合假设和服务提供商定价。
在设计评估时,可在多个检查点保留全新的留出回合,记录交互成本和反思成本,并在衡量表现曲线后检查失败轨迹。关键问题不仅是存储的经验是否有帮助,还包括失败究竟源于知识缺失、检索或复用失败,还是尽管看似存在相关指导仍然失败。
本文适用于设计部署后的学习评估:它将每单位学习成本带来的留出改进操作化,并把工件轨迹转化为针对经验缺失、未被使用和无效的具体诊断方法。
小型、反复使用的评估集可能夸大大语言模型自我改进循环报告的收益
The Winner’s Curse in LLM Self-Improvement Loops: Selection Noise, Lock-in, and Acceptance Rules
本文研究的自我改进设置会在某项改动于小型评估集上的得分更高时予以保留。论文具体关注由此产生的选择问题:被选中的得分是一种带噪声的测量,重复使用选择集可能会使它夸大在新数据上的收益。其模型将候选方案的误差视为单次决策中的相关误差,而不是把每个提案都简化为一个孤立得分。Qwen 模型会改写自己的指令,每个候选方案也都会在 600 个留出项目上评分;带有 oracle 工具的运行则比较测得的选择优势与留出优势。
确认性结果幅度很大,但有条件限制。在预注册的贪心循环中,使用 16 个选择项目时,最终选择集得分比留出准确率高 13–20 个百分点;使用 256 个项目时,高 1–5 个百分点。选择集增大与 TREC 上更大的留出收益相关,但这一模式未能推广到 GSM8K。在 oracle 运行中,使用 16 个项目选出最佳改写时,在测试的各种设置下,其留出选择优势仅为测得优势的 1–51%。
在这项研究中,改变接受规则并不足以解决问题。与贪心接受相比,所评估的替代方案并未提高完整运行的汇总留出表现,尽管它们在某些孤立的新数据集决策中有益;这并不表明所有可能的接受规则都会失败。一项实用审计只在 64 个从未用于选择的项目上,对起始指令和最终指令进行评分。在测试的运行中,它消除了平均偏差并降低了收益估计的 RMSE,但单次估计仍然过于嘈杂,无法可靠分辨较小的收益。
对于新的循环,可迁移的操作是:将重复使用数据集上的得分与独立的“从初始到最终”审计分开记录,然后报告带有不确定性的留出收益,而不是把被选中的得分当作进展。论文的适用边界很重要:其理论没有对锁定动态建模,也不对递归自我改进作出判断;作者还指出,高斯选择模型可能无法捕捉真实效应的厚尾特征。因此,有用的研究问题范围更窄:比较完整的自我改进流程时,应如何记录并改变审计规模、候选数量和选择集复用情况?
阅读本文可以了解一种具体的审计设计,用于区分循环中重复使用的数据集得分与留出收益;还可以了解改变接受规则是否改善了完整运行。
VoS 从逐步反事实中学习干预价值,而非仅依赖失败风险
From Uncertainty to Action: Learning to Steer LLM Agents
不确定性可以识别可能失败的轨迹,却不能可靠地识别在哪个步骤进行引导才有帮助。这正是本文揭示的具体监督局限:某种信号可以有效地为糟糕轨迹排序,却不擅长选择干预时机。在已完成的 AppWorld 轨迹上,失败检测排序与轨迹内定位排序之间的相关性,Gemma 为 -0.12,Qwen 为 -0.41。
该方法通过构建逐步结果表(Stepwise Outcome Table,SOT)将这一区别具体化:从每条参考轨迹的每个非终止步骤重新运行,在该步骤应用四种引导机制中的每一种,并让后续执行直至完成。SOT 记录最终任务得分的变化,包括失败轨迹的恢复收益,以及对成功轨迹造成的损害。该表包含约 82,000 条反事实续接数据,来自三个基准、两个智能体的 1,864 条轨迹。
随后,VoS 从 SOT 中学习每个步骤的引导价值,并据此决定在哪里进行引导;一个受损害预算约束的触发器负责决定是否引导,并限制受到干扰的成功轨迹比例。这与仅仅判断当前轨迹看起来是否有风险,是不同的控制目标。
证据虽有条件限制,但在研究范围内覆盖面广:VoS 在全部 12 种基准—智能体—模式设置中都优于未经修改的执行方式,最高分则出现在 11/12 种设置中。报告的平均收益是:相比未经修改的执行方式提高 7.8 分,相比五种经过测试的不确定性触发方法中最强的一种提高 2.9 分。在 AppWorld-Gemma 消融实验中,离线评估时,实测引导结果优于经过测试的失败、二元有用性和过程奖励目标;在线评估时,它在列出的目标中得分最高。
边界条件很重要。由于 SOT 需要针对每个步骤和每种机制重新运行智能体,构建成本很高。已展示的证据仅涉及两个可获取 token 分布的开放权重智能体;据报告,黑盒口头表达的置信度效果明显较差。损害预算经过校准,但无法保证在测试数据上达到目标。在采用更严格的仅回滚核算方式时,在线 AppWorld 中 Qwen 的 VoS 净变化为 -0.1 ± 0.3,因此并非每种设置下干预带来的特定收益都为正。
一项具体的研究操作是:在未被选中的候选步骤收集结果标签,针对每种机制训练价值预测器,并将干预定位与失败检测分开评估。接下来的问题是:当减少反事实重执行,或智能体处于闭源状态时,这种价值信号能否迁移?
阅读第 2–4 节,了解如何先把干预选择转化为可测量的反事实标注问题,再调整不确定性阈值。
已部署的任务验证器可能会对错误的持久化效果返回 PASS
Finding Blind Spots in AppWorld and WorkArena Task Verifiers
基于执行的验证器会将轨迹转化为 PASS/FAIL 判定,但这项审计会根据持久化效果来检验判定。审计采用基于源代码信息的变异测试;主要审计过程不会修改已发布的检查器。
此前的一项审计说明了相反判定方向为何重要:它认定抽样的 FAIL 判定中有 15.3% 不正确,但其明确说明的范围并未评估假阳性。本论文针对的是一类经过挑选的情况:检查器尽管面对经独立确认的错误效果,仍然给出通过判定。
在 AppWorld 中,重复执行一次非幂等写入会多创建一条记录,同时保留所有已检查字段的值。来自五个符合条件的生成器中的两个生成器所构造的全部三种任务变体都被验证器接受,涵盖了 6/15 个构造出的效果。清点后,将基数修补应用于检查器副本,使六个重复写入案例都从 PASS 变为 FAIL,同时有效对照仍然通过。
WorkArena 提供了最清晰的效果层面确认。一次前瞻性重跑针对 23 个额外字段候选案例;这些案例因先前检查器给出 PASS 而被选中。通过独立的 Table API 回读,审计在 21 个单元格中发现了已持久化的非默认范围外取值;检查器对全部 23 个案例都给出了通过判定。有两个请求字符串是已存储默认值的别名,因此这两个 PASS 案例属于效果正确的退化情形,而非经确认的错误效果。这些经过挑选的案例在审计方案下确认了相关机制,但不能据此推算总体发生率。
意图交换实验提供了一项有用的阴性结果,但其证据状态不同:固定网格在 2,689 次有效的非对角线执行中,检查器给出的 PASS 判定为零。作者将其报告为一次拒绝结果清点:57 个 WorkArena 单元格使用了会话范围内的证据,其余 2,632 个单元格则没有经过分类的拒绝原因,也没有独立的目标真实值。
由此可得一项可迁移的研究操作:记录检查器判定,独立回读精确的持久化状态,并为每个计数保留构造类型、选择条件和证据类别。将检查器副本上的修补用作诊断对照,而不要悄然改变正在审计的对象。
适用边界很重要。固定且经过挑选的清点无法估计部署运行被错误接受的概率。研究结果未涉及实时模型生成的对抗者、针对检查器的搜索或自然故障语料,因此,对自适应智能体、自然故障、其他检查器设计或环境变化的泛化能力仍未经检验。
阅读本文可以了解如何把验证器 PASS 漏洞转化为有独立证据支持的状态层面发现,同时避免把经过挑选的 21 个单元格重跑结果说成覆盖整个基准的错误率。
abstract; Section 3.6, paragraph 1; Section 3.5, subsection “Out-of-scope writes in WorkArena”; Section 3.5, subsection “Out-of-scope writes in WorkArena”; Appendix F; Section 3.3, paragraph 2; Section 5, paragraph 1; Section 8, paragraph 1 · §4.4, Verdict reliability; Table 2; Limitations, Audit scope
CredLeak-Bench 联合评估凭证泄露、合法任务效用与可信路径恢复
CredLeakBench: Evaluating Credential Leakage and Recovery in LLM Agents
凭证安全评估存在一个测量问题:泄露减少可能只是因为拒绝,而不是安全地完成任务。在所提供的对比记录中,Scammer4U 已经会测量精确存储的个人身份信息(PII)是否到达攻击者控制的端点,并采用良性孪生案例和单因素兄弟案例。CredLeak-Bench 的增量之处在于,将合法任务效用和可信路径恢复明确列为结果指标。这回应了论文提出的担忧:如果防御措施也会损害真实任务,仅减少泄露并不足够。
该基准使用八个类别中的 15 个虚构服务,并改变八种钓鱼线索;其定向套件和自主套件分别包含 512 个和 256 个场景。CredLeak-Bench 将欺骗性案例与合法对照配对,并测量实际提交情况,从而能够联合评估定向身份验证、自主收件箱监控和恢复任务中的泄露情况,以及合法任务未完成的情况。它评估用户指示下的身份验证和自主收件箱监控,也包含监控开始时用户并未要求进行身份验证的案例。恢复任务要求智能体向可信端点提交正确密码,同时不向钓鱼端点发送保管库信息。泄露依据已提交的合成信息评分,而不是依据智能体的叙述。
在定向和自主设置中,所有七个受评模型都发生了泄露,包括收件箱监控开始时用户并未要求身份验证的情况。在此次评估中,定向设置的泄露率为 31.3% 至 75.8%,自主设置则为 1.6% 至 53.1%。对每个模型而言,自主设置中较低的泄露率都伴随着较高的错误拒绝率,这说明仅看泄露情况会让谨慎地不完成任务看起来像是安全。在定向设置中,明确的域名验证指导让七个模型中的六个同时提升了安全性和效用;这表明在每一种干预下,观察到的安全性与效用之间的权衡并非不可避免。避免点击钓鱼链接很少能转化为通过可信替代路径安全地继续操作:在主要恢复子集中,模型的恢复率为 0%–24.2%。
一项有用的复现实验问题是:某项干预能否在不增加错误拒绝的情况下减少已提交的机密信息;随后,同一智能体能否通过可信路径完成真实身份验证。应分别报告这些结果,并检查特定线索导致的失败:尽管主机名正确,明文 HTTP 仍是每个模型在定向设置中泄露率最高的线索。
该基准使用虚构服务和本地模拟网页环境。HTTP 和证书警告线索由模拟生成,并非来自真实网络攻击或证书攻击;保管库策略是提示层面的指导,而非技术强制执行的访问控制。报告的对比涵盖同一测试框架中的七个模型。恢复任务的范围比下游任务完成更窄:它只检验智能体能否向可信端点提交正确密码,同时不让保管库信息到达钓鱼端点。
阅读本文可以据此重新设计智能体安全实验,分别评估三个问题:机密信息是否通过欺骗性端点泄露、智能体是否完成了真实任务,以及它能否通过可信路径恢复。
§3.2, Controlled Generation; §4.2, Evaluation Metrics · Section 3.2, Benchmark Design
