ObserverBench 根据下游行动损失评估机械化观察器,而不是仅凭预测准确度
ObserverBench: Testing Mechanistic Estimates for Intervention and Control
ObserverBench 关注一个内部机械化估计(“观察器”)是否足以用于它所指导的干预、控制或安全任务。每个任务固定模型、信息边界、允许的动作、决策规则、留出案例和损失。基准将估计精度与所选择动作引起的损失分开报告。该约定将观察器作为决策程序的一部分:相关的问题是它在留出案例上是否选择了更低损失的动作,而不仅仅是它是否准确地预测了一个内部量。
对于仿射目标和观察器读出,命题 1 表示充分性要求在起始状态以及由允许编辑生成的方向——即可到达子空间——上达成一致。该判据以仿射读出、已定义的起始状态和控制器可用的编辑方向为条件。在小型学习 Transformer 实验中,一个有限时域证书与最终误差的相关系数为 0.952,并且在 96.0% 的条件下正确给出符号,实验采用成比例反馈和第一块之后的残差编辑。
在 GPT-2-small IOI 上,全对观察器将留出候选掩码的平均效应 MAE 降至 0.395,而按头相加的可加性为 0.486,计数可加性为 0.473。但论文的解读是平均效应预测与动作选择是不同的任务:按提示的离散分布可能使得具有相同平均效应的掩码在损失上不同。在使用留出提示、冻结测量和冻结动作池的固定动作确认中,直接损失观察器将动作损失从 1.076 降至 0.833,减少了 22.6%。
在 Qwen2.5-7B-Instruct 上的预算化授权分流任务中,标签观察器的 AUROC 为 1.000,但部署损失为 3.334;在一个阻断前 10% 并升级下一个 10% 的控制器下,将其分数乘以严重性后 AUROC 降至 0.954,损失降至 2.155。
一个可迁移的实验操作是:在拟合观察器之前指定动作规则和损失,保留留出案例用于最终决策测试,比对以预测目标训练与以动作损失训练,并沿干预的可到达方向测试充分性。这些结果有作用域限制:控制分析假设仿射读出、单一固定方向、成比例控制且无截断,而其非线性测试使用一个具有已知二元特征的小模型。预训练模型研究使用固定检查点、选定的头集合、固定消融和狭窄的提示分布;IOI 确认是以试点信息并在本地封闭而非独立预注册的方式进行的。授权任务直接向 Qwen 询问授权裁决,因此不能建立唯一的隐藏安全状态或测试有害执行、欺骗或自适应攻击。
为围绕观察器所启用行动的损失重新设计可解释性实验:固定任务契约、测试留出决策,并检验更好的观察器是否真正改进了干预或分流结果。
来源位置
基于回复重写产生更强、更持久且双向的行为改变
训练数据归因(TDA)寻找塑造模型行为的示例,但影响函数(IF)估计的是无穷小重加权的效果。论文从一个实用失败案例出发:在仅改变权重的干预下,IF 选择的示例在优势上常常不及随机选择。该证据本身并不能证明所选示例缺乏杠杆作用;也不能排除重加权是实现这种杠杆作用的错误操作这一可能性。
作者在保留 IF 选择的同时改变了干预。他们的影响引导回复重写用 IF 确定目标,固定每条指令,然后将其回复替换为与行为一致或与行为相反的监督。在主要的弃权设置中,他们为一个留出的 300 查询目标使用 EK-FAC 影响分数选择 1,600 个示例——占 64,000 个 SFT 子集的 2.5%。随后他们从相同的基础检查点重新训练,在删除、加权、对齐重写或相反重写后,数据顺序固定。对留出评估的弃权召回是四个开权重大语言模型的主要结果量。
在这些条件下,所报告的对比在干预类型层面上是决定性的:重写产生了更强、更持久且可双向的变化,而对相同选中示例的重加权则弱且不一致。作者还报告删除和加权可能不稳定、未必优于基线,有时甚至朝相反方向移动。这并非证据表明在所有可能的权重计划或再训练制度下重加权都会失败;所报告的扫参覆盖了该 SFT 设置下的指定权重和干预预算。
改变编辑后选择仍然重要。在 OLMo2-1B 上,当比较等量重写集合时,据报道 IF 选择的示例比 probing、TRAK、一级梯度变体、损失和随机选择产生更大的重写杠杆。场景维度的弃权变化仍集中在目标场景上,而不会成为均匀的拒绝增加。安全拒绝扩展遵循相同的定性重写与重加权对比,但其对齐的安全收益伴随在良性提示上的明显过度拒绝成本。
一个可迁移的研究操作是将归因作为两阶段程序评估:分别测试“选择了哪些数据”和“应用了哪种许可的编辑”,然后衡量目标效应的持久性、双向性及其附带行为。该研究的作用域仍然狭窄:该框架最自然适用于可以明确撰写对齐和相反回复的场景,且标准 IF 构造仍然是局部重加权分析。
阅读此文以设计 SFT 数据策划实验,分离比较基于归因的选择与基于回复的编辑,而不是把弱重加权效应当作对所选示例的终判。
来源位置
仅靠路由分离可能无法阻止负迁移
Routing Is Not Enough: Diagnosing Intra-Adapter Subspace Contention in MoE+LoRA Fine-Tuning
失败模式
令牌级路由在域间可以近乎不重叠,但在 LoRA 适配的 MoE 中仍然发生负迁移:当加入生物医学数据时,路由分离并未阻止代码困惑度的增加。论文将此视为警告:以专家路由作为域分离的代理并不足以证明可训练更新空间已被隔离。
诊断与干预
作者引入了 Jaccard 路由重叠和适配器梯度余弦相似度,分别衡量专家共享和更新兼容性。他们报告按域的 LoRA 适配器梯度基本上不对齐(近乎正交),将干扰机制指向适配器内部的梯度竞争而非共享路由。在所报告的代码–生物医学实验中,20 次试验的聚合梯度余弦为 ,而伴随的路由重叠接近不重叠。
SpawnLoRA 在专家内部实现了输入门控子适配器,从而在不改变令牌路由的情况下新增适配路径;专家输出因此为冻结基础权重、一个基础 LoRA 适配器以及门控子适配器输出之和。因而所建议的改变是在已经选定的专家内部进行结构性分离,而不是更改路由器或仅扩大一个共享适配器。
证据表明了什么
在研究的混合与架构中,SpawnLoRA 比标准 LoRA 和一个秩自适应基线(DR-LoRA)更能减少负迁移(降低代码困惑度和方差)。所报告的比较覆盖 Phi-tiny-MoE-instruct 和 OLMoE-1B-7B,在 80/20 和 50/50 混合下,并给出三个随机种子的均值和标准差。作者的解读是:在强领域冲突下扩大共享适配器秩(DR-LoRA)可能加剧负迁移,因其增大了近乎正交梯度竞争的共享子空间。
一个有用的研究操作是:在多域 MoE+PEFT 运行中,在假定路由已隔离更新之前记录路由重叠和按域适配器梯度余弦。如果路由已分离但梯度兼容性差,比较共享秩增长与创建门控、本地化适配路径的机制;将此视为一个可检验的设计问题,而非万无一失的补救措施。
边界是显著的。作者写道,诊断和缓解在 B 参数或显著更长训练运行下是否稳健“仍未解决”。他们的头条结果使用困惑度,并声明在受控的 2,000 示例训练规模下 HumanEval pass@1 并不具有信息性。他们也未确定所报告的梯度模式是否扩展到差异较小的域对或超过两个域的情况。
阅读此文以设计具体的诊断消融:在为多域 MoE 微调选择扩秩或拆分适配器之前,测试低路由重叠是否真与兼容的适配器梯度并存。
来源位置
一种一致的模型偏好:在上下文冲突解析中偏向更早出现的证据
Large Language Models in Resolving Contextual Knowledge Conflicts
以往关于知识冲突的大部分工作集中在模型的参数化知识与外部提供的上下文不匹配上。Yang et al. 则研究了来自所提供上下文内部的冲突([Abstract])。他们的 ContextConflict 数据集包含 5,781 个样本,并定义了六种冲突类型——错误信息、推理、时间、粒度、视角和歧义——覆盖推理和总结任务([§2])。它既包括显式的矛盾,也包括需要多步推理的隐式情形,因此该基准并不限于直接对立的陈述。
经验问题是模型是合并不兼容证据还是仅仅选择一个答案。作者报告现代大模型在该基准上仍然表现不足([§3.3])。在使用本文时有一个报告细节值得核查:摘要写明实验覆盖九个大模型,而所给的 §3.3 证据记录描述了七个具名模型。因此结论具有基准特异性,推理由准确率评估,总结由平衡性和忠实性评估。
诊断性贡献超越了最终输出。作者报告在潜表示层面存在对上下文冲突的潜在觉察,不同冲突类型在不同层深出现并占据不同的潜在几何([§4.1–§4.2])。他们还报告了对更早位置证据的一致偏好,在表示和输出层面均可见,并将这种位置偏好解释为对全面证据整合的障碍([§3.3; §4.3])。一个可迁移的实验直接得出:在评估多文档系统时,打乱证据顺序并测量答案质量及各源贡献,按冲突类型分别度量而非仅看总体。
在干预方面,作者提出“一种简单的无训练、无标签的引导方法”以将激活引向更全面地吸收证据([Abstract])。他们报告在 ContextConflict 上提高了推理准确率并获得更高质量、更平衡的摘要。这些是基于该基准的结果,并非证明该干预能处理嘈杂的检索管线:作者声明评估异质的真实世界检索证据仍是未解问题。该方法还需要白盒残差流访问并在推理时增加开销,因此仅适用于开权重模型;引导实验仅限于 8B 和 20B 的 GPT 与 LLaMA 模型([Limitations])。一个有意义的后续问题是:当证据源可靠性不同,是否应保持对称再平衡,因为论文所用的基于 Shapley 的归因假定每个证据片段的期望贡献相等。
阅读此文以将证据次序敏感性转化为可测量的多源评估,并考察一个具有明确部署限制的白盒激活引导干预。
来源位置
在 27 组报告的长上下文对比中,trace-before-context 在 26 组中优于 trace-after-context
Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers
限制在因果次序
作者提出了因果次序不匹配:长上下文推理可能依赖于仅在稍后发现的任务状态,而变换器以因果顺序处理信息。在他们形式化的条件状态更新设置中,比起在信息序列之后提供条件,在信息序列之前提供条件在最坏情况下可能需要指数级更少的记忆。这是关于所述处理器设置的形式结果;所给证据并不证明其最坏情形的效应大小会直接预测部署中的变换器行为。
方法:先将 trace 作为状态重读
“Trace as State” 运行一个读—计算—反馈—重读程序。它收集一个或多个第一遍的推理轨迹,将其序列化为一个轨迹块 T,然后以提示顺序 [T, x, q] 进行新的因果通行:轨迹、原始长上下文、问题。轨迹被作为任务状态的文本代理,因此先前通行中获得的信息在模型重读上下文时可用。
匹配对照 “Trace Append” 使用相同的轨迹块但将提示顺序设为 [x, T, q]。因此排序——而不仅仅是新增生成文本——成为中心实验对比。
报告测试显示了什么
在三个模型、三个长上下文数据集和报告的指标中,Trace as State 在 27 种组合中有 26 种优于 Trace Append。在 GraphWalks Parents 上,DeepSeek V4 Pro Preview 在初次通行的精确匹配为 29.2%,Trace Append 时为 43.0%,而 Trace as State 时为 81.8%。对于 GLM-5.2,相应的报告值为 66.4%、83.2% 和 100.0%。
对于 GraphWalks 256K 上 DeepSeek V4 Pro Preview 的消融也削弱了两种更窄的解释:随机轨迹表现不如无轨迹的第一遍通行,且仅提供轨迹而无原始上下文仍低于 Trace as State。这些是针对一个模型和任务族的受限消融,而非证明每个生成轨迹或每个领域都会如此表现。
接下来要测试的内容
一个聚焦的后续工作是保持生成轨迹固定,并在匹配的令牌预算下比较 trace-before-context 与 trace-after-context。报告答案质量同时报告额外通行次数、令牌成本、延迟以及任何键值缓存复用的损失。所评估的文本实现要求原始推理轨迹或另一个暴露的状态接口;仅暴露最终答案的模型或 API 可能需要另一种接口。作者仅测试了三个因果变换器模型和三个任务族,且未评估多轮代理任务。
它提出了一个可精确检验的长上下文干预:固定生成轨迹但将其从上下文之后移动到之前,衡量因果次序(而非额外文本)是否解释结果,以及额外推理开销是否物有所值。