2026-09-16
2026-09-16
使用检索语义提示训练的代理在需要代码执行的数学题上学会发出不必要的检索调用。
Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act
研究的核心局限是工具选择策略,它根据表面提示线索而非真实任务需求来调用工具。在将事实问答与数学推理结合的受控合成环境中,Yang 等人在训练期间注入与特定工具高度相关的线索,同时使这些线索在因果上与是否需要该工具无关。
反事实测试。 作者将工具虚相关定义为“对功能上不适当工具的、由线索驱动的工具选择概率膨胀(cue-driven inflation of tool-selection probability for a functionally inappropriate tool)”。他们用成对的反事实输入来操作化该概念,这些输入在是否存在线索上有所不同,并报告了 (\Delta\mathrm{Tool}_{Y-N}):即在有线索与无线索变体之间,功能不当工具的选择率差异。这为一个代理项目提供了具体的评估操作:构造任务等价的提示对,然后测量一个无关标记是否改变了行动策略。
在使用 Qwen2.5-7B-Instruct 并用 GRPO 微调的实验中,在一个有针对性的条件下报告到的效应很显著。研究者在事实问答训练示例中注入了检索-语义(search-semantic)线索,然后在检索在功能上无帮助且需要代码执行的数学题上进行评估。代理发起了不必要的检索调用,虚假的检索率最多上升了 39.2 个百分点。该效应是选择性的而非普遍性的:作者将其实验解释为捷径脆弱性与任务能力强相关。在他们的不对称设置中,当代理在事实 QA 上学会使用检索时会形成检索捷径,而当代理在数学任务上没有学会使用 Python 时,对应的 Python 捷径并未形成。
语义内容与能力同样重要。在一个交换线索的测试中,将代码语义线索附加到那个已充分学习的事实任务上,产生的 (\Delta\mathrm{Search}\leq3.5\%),远低于对齐线索(aligned-cue)时的结果。作为缓解措施,作者在决策层添加了密集的必要性奖励(dense decision-level reward),由一个 LLM 裁判评估每次工具调用的必要性;他们报告该措施在抑制由线索驱动的调用同时保持任务性能方面有效。
边界与下一个问题。 这并非已部署代理普遍存在该问题的证据:训练使用了 1,000 个示例、30 步、一个 7B 基模型和每次运行的一个种子。必要性奖励还依赖于 GPT-5 Nano,作者把它描述为一种实用选择而非决定性的必要性真实标签。一个有用的扩展是跨不同种子重复成对线索审计,并将裁判标签独立地与人工注释进行比对验证。
学习一种紧凑的反事实审计方法,以检查一个 RL 代理是否因为工具被需要而选择它们,还是因为提示线索能预测到它们。
Abstract; Definition 1 and §2.2; §5.2–§5.4 and Tables 1 and 3; Appendix A.2; Ethics Statement
Gavel 从冻结的 LLM 中用两张线性映射读取技能路由信号
The Router Within: Eliciting Native Skill Routing from a Frozen LLM
SkillRet 在孤立情况下评估检索质量,并不衡量下游任务成功或端到端代理性能。Gavel 针对不同的路由约束:论文报告从冻结的代理 LLM 本身中提取选择信号,而不在选择前将技能文本放入上下文,也不添加独立的大型检索器。
Gavel 分两阶段路由:先对整个技能库进行一瞥(glance),然后对候选短名单做判决(verdict)。在一瞥阶段,将任务与每个技能的中间层状态通过两张训练过的线性映射投影,然后用安装时构建的、每技能的紧凑键库对库进行评分。判决阶段在把入选技能加入上下文后恢复(resume)冻结模型,读取任务似然度和一个显式的是/否判断。它们的分数作为专家乘积(product of experts)融合。一体化的安装时键库也可以被压缩:在 Qwen3-32B 构建中以 ε=0.83,论文报告键库大小约减少 8.5×,代价最多约为 1.6 个基准点。
在冻结的 Qwen3-32B 骨干上,作者报告 Gavel 在书面任务基准上比添加了 1.2B–16B 外部参数的逐步披露(progressive-disclosure)和检索再重排(retrieve-and-rerank)流水线最高高出 13.4 个百分点,在需要在中途路由时最高高出 21.9 个百分点。比较包括 SkillRet、SRA-Bench、Eval-Core 和 SkillTraj,Hit@1 的裁定由 GPT-5.6 Sol 执行。消融实验支持融合设计:完整的 glance-plus-likelihood-plus-yes/no 判决在每个测试基准上得分最高,超过表现更好的单信号变体在 SkillRet 上 1.9 点、SRA-Bench 上 3.8 点、SkillTraj 上 4.6 点。
这些增益仍有测量边界。对自动裁判的人类验证在 200 对抽样对中对信贷决策达成一致 171 对,或 86%,因此经裁定的 Hit@1 并非无噪声。报告的迁移也绑定于所述基准设置,而非已建立的在线流量鲁棒性。论文没有解决相同的读取方式是否可以用于从代理自身的前向传播中路由工具、记忆或 MCP 服务器的问题。
一个聚焦的后续实验是只训练那两张读出映射,保持骨干冻结,并测试当技能库、查询风格和轨迹中的路由点改变时排名是否保持稳定。一个有用的研究问题不仅是内部状态是否能预测下一个技能,而是当该信号相对于外部检索器失效时何时失效,以及判决的额外一次前向传播是否改善了任务完成率而不仅仅是裁定的路由准确率。
为了获得一个具体处方——中层读出、安装时 ε-覆盖压缩、以及专家乘积融合——并据此设计一个分布转移测试,以在将该想法应用于工具或记忆前检验内部路由。
Abstract; §3.2–§3.5; §4.1; §4.3; Appendix F.2 (Table 3); Appendix H.2; §5 Conclusion · §6 (Limitations)
ReImaGin 将图像生成用作灵活的视觉推理工具
Reasoning with Image Generation
文本链式思维(textual chain-of-thought)并不适用于需要直接操控视觉表示的任务。论文的具体目标是专用视觉工具的局限性:它们的操作狭窄且僵化,而无法灵活地生成或变换视觉内容。
ReImaGin 无需训练并且模块化:它调用单一的指令式图像生成器以进行开放式变换,并在可解释的像素空间中执行视觉推理。与固定功能工具不同,该生成器接受自然语言命令来执行诸如去除遮挡或从不相连的房间视图生成平面图等操作。报告的比较在六个视觉推理任务上使用了仅文本推理与专用视觉工具基线。
对研究者最具可操作性的机制是选择而不仅是生成。在 MMSI 多视角空间推理上,采样 10 张图像并用 MLLM 选择最忠实的候选图像,将 Gemini-3.1-Pro 的准确率从 51.0% 提高到 59.0%,将 Qwen-3.5-27B 的准确率从 42.0% 提高到 54.3%。论文还搜索可视化策略:proposal 与 reasoning 代理在小的训练/开发集切分上评估任务专用提示。在每个切分最多 50 个示例并进行四轮的设置下,自动发现方法恢复了手工策略的大部分增益,尽管在需要更复杂策略的任务上仍存在差距。
一个可迁移的实验是将视觉中间表示视为假设而非解释:定义一个应当暴露任务相关关系的变换,采样若干输出,选择或验证它们,并同时测量答案准确率与变换忠实度。这将“生成是否有用?”与“代理是否在可靠的表示上推理?”这两个问题区分开来。无操作(no-op)消融支持这种隔离:用返回输入的工具替代生成在所有六个任务上都降低了性能,最大降幅出现在路径追踪(path tracing)(89.0 降到 77.5)和拼图完成(puzzle completion)(42.3 降到 36.5)。
边界是操作性的。相较于专用工具基线,生成调用增加了成本和延迟,并且提示发现的成本在报告配置下约为每个任务 $214。自动策略也可能请求生成器难以可靠执行的变换:当对着色线条的执行不如把线条变实时,稍微复杂的策略会略微损害性能。在 Gemini-3.1-Pro 的深度推理上,专用基线仍然领先,99.2% 对 ReImaGin 的 94.6%。因此有用的研究问题是哪些中间表示值得其生成和验证预算,而不是图像生成是否能够普遍替代专用工具。
阅读这篇论文以学习如何让 MLLM 提议、采样并验证任务专用的视觉中间表示,同时测试生成器的忠实度与运行时成本是否足以替代固定的专用工具。
在四个社会模拟任务上,SAE 与探针引导常常优于仅用提示的操控
Interpreting and Steering LLM Agents for Social Simulations
基于 LLM 的社会模拟存在一个具体的测量问题:需要可解释性以将观察到的行为分配给明确机制,同时需要可控性以抑制或放大理论上有意义的机制。Fan 等人在 Llama-3.3-70B-Instruct 上比较了基于提示的操控、由 SAE 导出的特征引导(SAE-derived feature steering)和基于探针的方向性引导(probe-based direction steering),覆盖四个自然语言任务:彩票风险(lottery risk)、最后通牒利他(ultimatum altruism)、发散性创造力(divergent creativity)和产品创新(product innovation)。
方法上的变化是将内部表征作为干预的一部分,而不是把提示视为唯一的控制面。SAE 用于将表征分解为可读、与行为相关的特征;然后用探针沿指定方向改变行为。在所报道的实现中,探针在第 48 层激活上训练并用一个标量方向进行引导,而 SAE 引导则推动选定的风险相关特征。这创造了一条从归纳到演绎的工作流程:用 SAE 特征提出机制假设,然后用探针测试并控制一个行为维度。
最清晰的证据是校准性。在彩票任务中,探针引导将切换点放置在大约 30–200 tokens 范围内,使用每个条件 40 个代理时的均值绝对误差约为 大约两个 token。SAE 引导也表现出剂量依赖的过渡:中等强度引导在大约 75 tokens 处开始改变行为,而更强的引导将过渡移向 65–70 tokens。提示法在各特质上的一致性较差:没有哪种提示变体产生了分级的风险寻求(graded risk-seeking),而少样本 chain-of-thought 将最后通牒接受阈值从大约 10 提高到了 40 tokens 左右。
边界很重要。实验聚焦于个体而非多代理网络或影响机制,特质集合较小。SAE 引导在被推得过远时会出现幻觉(hallucinate),且不完美的特征解耦可能激活非目标表征。探针方向也不是自动在上下文不变的:一个在砖块创造性数据上训练的探针能迁移到其他对象,但探针精度下降了大约 5–6 个百分点。
作为后续研究,应该将 SAE 可读特征视为假设而非已验证的因果:针对行为目标拟合并校准探针,然后在保留对象或任务上扫过其系数,同时记录离靶变化。一个有用的研究问题是该干预能否在不改变无关行为的情况下改变预期的社会特质。
学习一种替代仅用提示操控个性特质的具体方法:识别候选内部特征,校准基于探针的控制,并测试其跨情境与离靶行为。
abstract1.1; S4.SS2.SSS1.p4; S4.SS2.SSS1.p2; S4.SS2.SSS1.p3; A2.SS7.p3; S5.p9; S5.p10; S5.p11
计划注入在作者的测试中可引导执行者并逃避链式思考监视
Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection
限制项被检验的内容
链式思考(Chain-of-thought, CoT)监视会检查执行者模型的推理以寻找不安全的计划、欺瞒或失配。本文检验了一个输入完整性缺口:被放入执行者上下文的有害但听起来无害的推理可以在逃避该检查的同时引导后续行为。作者将该攻击称为计划注入(plan injection)(§Abstract)。
方法变化
作者首先在 TruthfulQA 多项选择提示设置中用一个调查者-代理(investigator-agent)设置发现对抗性计划。有趣的是,最有效的这些变体之一标记为 cot_pure,仅仅是将有缺陷的注入计划附加到查询中而没有任何显式指令去使用或遵循它(§3.3)。随后他们在 APPS 编程任务和配对的生物-数学(Bio-Math)设置上评估注入计划,考察执行者是否采纳注入的推理以及监视器是否标记相应的对话记录。
该研究的实用研究动作是同时评估“引导”(steering)和“可检测性”(detectability)。一种能改变行为但立即被标记的计划,与一种能改变行为同时生成看似自发且被监视器接受的理由的计划是不同的。
证据与条件
在 APPS 上,论文报告“执行者遵循注入计划的比例为 Qwen3-8B 为 50.6%,DeepSeek-R1 为 41.7%”(§5.3)。这些数字适用于论文经验证的 APPS 注入,其嵌入代码已针对公开测试与所选后门输入进行核验。在 Bio-Math 中,使用经验证的改写计划,报告的采纳率为 93.0% 和 98.9%;这些为 best-of-three 的采纳率,因此不应被解读为单次尝试的成功率(§5.3)。
监视器结果依赖于作者的监视器套件和怀疑阈值:监视器“未能标记至少 25% 的尝试”,而非思考型监视器在一些评估设置中漏报“高达 76%”(§1)。在所测试的预算扫描中,增加监视器的推理预算并非一致有效的补救措施:“增加监视器的推理预算并非均匀有益”(§6.3)。
边界与研究操作
作者的扩展实验涵盖两个推理模型和两个任务,且未展示通过 RAG、工具输出或多代理流水线的端到端攻击(§7)。因此一个有用的后续实验是将每个检索到的计划或中间轨迹视为不可信输入:改变其来源与措辞,然后测量行为采纳与监视器检测,而不是假定可见的连贯理由就是安全证据。
它提供了一个用于 CoT 安全的具体评估模式:测试不可信上下文计划是否既能引导执行者又能逃避监视,同时明确报告所用模型、任务、聚合与采样限制。
本期按 2026-09-16 的候选论文事后编制,核验日期为 2026-09-16。
