2026-10-03

2026-10-03

只有在因果接口可识别且可执行时,它才有助于模块化 LLM 智能体

When Do Causal World Models Help Modular LLM Agents

一条轨迹可能显示付款先于发货,却无法确定是付款授权了发货、库存介导了这一影响,还是某个隐藏触发因素同时解释了两者。FedCausalCompose 改变了研究目标:它将局部操作用作跨模块接口的干预—响应证据,并将这些接口组合成因果世界模型。

在论文设定的后门和分布偏移条件下,观测数据上的贝叶斯预测器具有正的干预超额风险,因此仅增加观测数据并不能消除这一差距。在论文的覆盖假设下,漏掉真实接口边的概率会随着匹配的干预—响应机会最小数量增加而呈指数下降。当机制误差和组合误差足够低、接口覆盖足够充分时,预言机 FedCausalCompose 的误差严格低于论文给出的非因果下界。严格占优这一结果是预言机层面的保证,以接口覆盖充分、局部机制误差和组合误差受控为条件;它并不保证受测智能体流水线能够可靠地学到这些量。

智能体诊断检验的是恢复出的结构在采取行动时是否可用。在 APIBank Stateful 单元中,按序列基线、发现边和预言机边提示的顺序,报告的任务成功值从 3.61 上升至 4.64,再升至 5.67;不过,与之对应的 ROUGE-L 值并未呈现相同的单调趋势。在 τ-bench 零售锚点诊断中,加入锚点后,序列、发现因果和预言机因果提示的成功次数分别从 70/45/45 变为 60/60/75。在 ALFWorld 诊断中,提高正确边的比例并未可靠地提升成功率,这支持作者的审慎判断:原始边列表未必能指导叙事环境中的控制。

解读这些智能体结果时需要谨慎:大多数 LLM 智能体实验单元都是单种子点估计,按数据划分计算的 Wilson 半宽约为 ±7% 至 ±21%。实验使用集中式轨迹测试框架,因此没有检验保护隐私的去中心化执行。原型的模块化设计和预言机边均由作者设计。对于新的模块化智能体,可分别改变匹配的干预—响应覆盖度,以及能使接口决策具有相关性的注意力锚点,并分别报告干预预测和任务成功率。这样的操作可以检验因果接口是可识别、可用,还是两者兼具。

阅读本文,了解如何区分因果接口的恢复,与智能体在选择行动时是否真正使用恢复出的结构。

Abstract; §§3–7; Appendices A.2 and A.4–A.6; §5, Table 1; §7 Limitations

在三个视觉语言模型中,中间层真值信号通常经不起激活修补检验

Encoded but Disconnected: Decomposing Vision-Language Model Failures under a Patching Null

可解释的信号并不自动就是控制点。早期的 tuned-lens 研究会为每一层学习一个仿射转换器,使中间状态能够模仿模型后续的预测分布。本文针对视觉语言模型(VLM)的错误提出了不同的问题:当中间层读出结果指出了真实答案时,改变该状态会改变最终预测吗?为此,本文将中间层解码与残差流及逐注意力头的激活修补结合起来,而不把可解码性视为因果证据。

在三个模型共有的基准 POPE 上,评估扫描中间层的答案信号,并在选定的层、位置和注意力头上,用正确供体样本的残差状态修补接收样本;比较仅限于标签不同的样本对。作者还将错误归为三种操作性模式——感知失败(Perception Failure)、已编码但未连接(Encoded-but-Disconnected)和先验覆盖(Prior-Override),并报告称,在每种架构上,这些类别都能以高于 60% 的准确率学习。

核心结果是层级上的明确否定:在 68–91% 的错误中,中间层编码了真实答案,但在所报告的实验方案下,对 LLaVA-1.5-7B、Qwen2.5-VL-7B 和 InternVL3-8B 进行残差流修补,产生的非平凡预测翻转比例为 0%。逐注意力头扫描在 Qwen 的每个受测组合上也都没有效果,涵盖 12,600 次修补前向计算;LLaVA 的唯一 1/32 组合被视为噪声。InternVL3 则是例外:第 20 层第 2 个注意力头呈现局部效应,作者将其描述为一个非词表、自注意的注意力头,p<1e-4。不过,与范数匹配随机对照的比较处于临界水平,p=0.056,因此论文并未确立该注意力头的具体计算作用。

类别分析可用作生成假设的工具,但还不是成熟的缓解系统。在使用预言机标签时,LLaVA 上的 Re-Promote 会翻转 85.9% 的“已编码但未连接”错误和 85.7% 的感知失败错误;而在 Qwen 和 InternVL3 上,提示去偏分别会翻转 19.6% 和 21.3% 的先验覆盖错误。论文报告称,使用预测类别进行路由并未带来净准确率提升。

开展新的可解释性研究时,可以借鉴该实验方案的逻辑:用探针生成假设,对匹配的跨样本状态进行修补,加入噪声和范数匹配对照,并明确说明结果涵盖的是哪一类干预。这里的因果结论仅限于标准残差流修补和逐注意力头修补;它并未排除更细粒度的归因或路径修补能够检测到的效应。同样,不应将以预言机条件为前提的干预响应表述为可部署的端到端改进。

读这篇论文,可以了解如何把高准确率的中间层探针转化为因果检验,以及如何解读以预言机错误标签为条件的干预结果。

abstract; Experiments, The causal null: mid-layer encoding is not causally active; Appendix C, Per-Head Patching: Full Sweep Details; Experiments, L20 head 2 on InternVL3; Appendix C, Table 5; Per-Category Intervention, Table 2 and Scope of the evaluation; Discussion, What we do not claim · Section 1, paragraph 4; Section 3, Equations 8–9

贝叶斯微调植入了可用信念,但推荐读出仍不完善

Bayesian Fine-tuning Yields Language Models that are as Bayesian as their Beliefs Allow

仅看答案准确率,无法判断语言模型是否具有贝叶斯信念、是否在计算中使用这些信念,或是否将其转化为贝叶斯选择。本文考察的是:在贝叶斯推荐上微调,是否会改变这些内部阶段,而不只是改变最终答案。论文所针对的具体基线局限是:在真实答案上进行标准监督微调(SFT),其效果不及在贝叶斯模型输出上训练所获得的近贝叶斯行为。

该方法改变了训练信号:BayesLM 在 BayesAssist 的推荐上微调,而 OracleLM 则在用户的真实选择上微调。评估分层考察行为、可解码信念、对类信念信息的因果敏感性,以及从信念到策略的读出。由此可得一项有用的研究操作:测量输出一致性,解码候选信念,对这些信念实施干预,然后检验它们是否支持模型自身的决策,而不是只依赖单一行为分数。

在 Gemma-2 9B 原始的留出航班推荐数据集上,BayesLM 的贝叶斯准确率为 0.84,而 OracleLM 为 0.69;该指标衡量的是与 BayesAssist 的一致性,而非与用户真实偏好的符合程度。线性探针从两个微调模型的中间层中恢复了与先验、似然更新和后验相关的量;据报告,BayesLM 的信念解码能力强于 OracleLM。在所选的先验原型修补设置下,BayesLM 在第 18–25 层的平衡准确率达到 0.77,而 OracleLM 为 0.52;这表明注入信念变化后,BayesLM 的推荐更常朝预期方向改变。跨模型修补转移了部分优势:BayesLM 的信念原型将 OracleLM 的平衡准确率从 0.52 提高到 0.61,而反向修补则使 BayesLM 从 0.77 降至 0.61。对探测出的信念进行外部期望效用读出,相较于 BayesLM 仅带来小幅提升(+0.02),相较于 OracleLM 的提升则更大(+0.09)。

综合来看,这些测量支持的结论比“模型是贝叶斯的”更为有限:贝叶斯监督与更强的可解码信念结构,以及在所选干预下更高的推荐敏感性相关;与此同时,OracleLM 并未在其原生推荐中充分表达所编码的、与贝叶斯相关的信息。

这些结论的边界很重要。线性探针证明的是可解码性,而不是模型信息内容的全貌。因果干预只在固定层和词元位置替换先验,因此无法证明模型内部进行了期望效用计算或形成了完整策略。主要证据还来自一项结构化推荐任务,其假设包括奖励特征相互独立;这些发现能否迁移到结构较弱或解析上难以处理的任务,尚不明确。对于新的不确定性推理研究,本文最可复用的经验是:区分信念形成、信念使用和策略读出,并报告失败发生在哪个环节。

阅读本文,可以了解如何区分内部信念错误,与模型未能使用原本可解码的信念这两类不确定性推理问题,同时留意其单一任务和特定干预所限定的证据范围。

abstract

生物推理准确率并不能证明模型使用了所提供的表征

When Do Biological Reasoning Models Use Their Biological Inputs?

评估上的缺口

本文考察一个具体的解释问题:基准准确率常被视为证据,表明生物推理模型确实依据所提供的基础模型表征或生物文本进行推理。然而,仅凭准确率无法证明改变某个特定输入会改变预测。研究评估了六种模型在 DNA、蛋白质和单细胞任务上的表现。

测试方式的变化

对于每个选定输入,作者在保持查询和其他输入不变的同时扰动与任务相关的内容,然后测量预测变化和任务表现。作者还通过将来自某个基因组、蛋白质或细胞的基础模型表征,与来自另一个对象的文本配对,构造证据冲突,并记录模型输出遵循哪一来源。当模型表现对某个输入不敏感时,线性探针会检验目标是否仍可从语言模型接收的表征中解码出来。这样可以区分表征中存在的信息,与模型已被证明会使用的信息。

结果

在 BioReason RL 的疾病预测评估中,对 DNA 窗口进行打乱并重新编码后,在 1,449 个源自 KEGG 的查询上,准确率仍为 0.847,而非 0.847;尽管有 101 个单独答案发生了变化。在相应的证据冲突中,BioReason 的预测有 97.9% 与基因/通路文本来源一致,而非遵循不匹配的 Evo2 表征。对于 BioReason-Pro,在 GO-GPT 和 InterPro 输入保持完整时,打乱蛋白质序列仅使 IA 加权 Fmax 从 0.855 变为 0.856;其冲突情形下的输出有 99.7% 与 GO-GPT 来源一致。

这些序列结果并不能代表所有生物输入。对于 Cell2Sentence-Scale 27B,在五个图谱和 4,846 个细胞中,打乱基因顺序后,细胞类型平均准确率从 0.446 降至 0.351;另有证据表明,差异表达基因对表现有所贡献。探针能够从 Evo2 和 ESM3 表征中预测任务目标,但探针成功并不能证明推理模型能够访问或利用这些信号。在 BioReason-Pro 的 SFT 和 RL 检查点以及 42 个 BioReason 检查点中,准确率较高同样不意味着生物输入的贡献更大。

可迁移的操作

对于新的多模态模型,可以借鉴这项三部分审计:匹配输入扰动、使用未修改输入的证据冲突,以及表征可解码性探针。分别报告总体指标的变化和答案发生变化的比例,并将探针准确率视为信息可用的证据,而非模型使用该信息的证据。应谨慎解读输入打乱的结果,因为打乱可能使表征偏离自然序列的分布。研究结论仅适用于评估的六种模型、任务、输入和数据集;将预测性训练文本与生物输入贡献较弱联系起来的比较,并非受控因果比较,因为架构、任务、训练数据和规模也各不相同。

阅读本文,可了解一套可复用的多模态推理审计:论文结合匹配扰动、未修改证据的冲突测试和表征探针,并说明为何不能把可解码性与模型实际使用信息混为一谈。

abstract; Section 4.1, Biological perturbations; Table S2; Section 4.1, Evidence conflicts; Figure 3a; Section 4.1, Biological perturbations; Table S3; Section 4.1, Evidence conflicts; Figure 3b; Section 4.1, Biological perturbations; Figure 2e and Figure 5; Section 5, Limitations and future work; Appendix B.5, Discussion of training-time availability of predictive text

ICR 通过纠正与保留审计多智能体通信

Beyond Final Accuracy: Auditing Communication in LLM Multi-Agent Systems

最终准确率对于评估多智能体通信而言过于粗糙:它把被纠正的错误与被破坏的答案混在一起,也无法区分通信效应与有利的架构或额外推理所带来的影响。作者提出独立—通信—修订(ICR)协议,以明确呈现这些修订效应。

在 ICR 中,智能体首先生成彼此独立的推理记录。该协议会冻结这些记录,并在不同通信条件下重复使用;它评估有向、单跳的发送者—接收者事件,且不在事件之间传递修订结果。协议测试仅答案和全文两种消息、潜在通信,以及一种无消息修订对照;后者旨在衡量超出额外推理本身的收益。正确性标签仅用于离线筛选、分层和评分,不用于构造消息或驱动修订。

关键指标以两个智能体最初的正确性为条件。纠正率(CR)衡量正确的发送者能否帮助最初答错的接收者;保留率(PR)衡量最初答对的接收者在发送者答错时能否保留自己的答案。选择性汇总了这些行为,但论文提醒,不能因此省略分别报告 CR 和 PR。

当总体准确率看起来稳定时,这些指标的价值便显现出来。在 GSM8K 上,估计的总体准确率相近,但保留率差距很大:Qwen3-4B 各条件下的 PR 从 46.74% 到 73.91% 不等,相差 27.17 个百分点;而估计的全数据集准确率仅在 94.68%–94.79% 之间。这些全数据集准确率依赖于对未观测修订结果的假设,因此该示例并非完全基于实测准确率的比较。在 MedQA、ARC-C、GSM8K 和 GPQA-D 上,与仅答案相比,全文会使修订更多地转向纠正、较少地转向保留;在 GSM8K 上,纠正率增加的报告区间包含零,而四个基准上的保留率下降区间均不包含零。

接收者策略同样重要。在 MedQA 和 GPQA-D 上,对于测试的三种通信条件,结构化验证的 CR 均低于批判性评估,PR 均高于批判性评估;但它对选择性的影响并不一致。这一结果支持将通道行为视为消息内容、传递界面和接收者策略共同产生的结果,而非通道固有属性。

一项可迁移的研究操作是:冻结初始轨迹,加入无消息修订对照,并在声称通信改善系统之前,按两个智能体的初始状态分别报告纠正和保留情况。对潜在通道的比较应明确其适用范围:这些结果评估的是 ICR 单跳协议中经过调整的消息—界面组合,而非可能被借鉴机制的完整原生系统。所报告的自助法区间也未涵盖未观测生成种子之间的变异。

阅读本文,可以用受控测试取代单一准确率变化,检验智能体通信究竟纠正了答案、保留了答案,还是仅仅增加了一轮推理。

abstract; §3.1, paragraph 2 and paragraph 3; §1, paragraph 3; §3.2, paragraph 4; §4.2, paragraph 2; Table 1; Table 1 caption; Appendix G, Interpretation; §4.3, paragraph 2; Table 3; Appendix I.3, Table 19; §4.4, paragraph 3; Table 4; §3.3, paragraph 2; Appendix B, Comparison scope; §3.3, paragraph 5; Appendix C.1, paragraph 3