2026-09-18
2026-09-18
在实体承诺之前,关系信息控制最终标记的回忆
Relation Before Entity: Deferred Commitment in Language Model Factual Recall
问题
本文分离了事实回忆中的时间问题:诸如“capital-of”之类的关系类型信息和诸如“France → Paris”之类的实体特定信息是否在最终预测位置于相同深度同时成为因果活跃?其方法论靶目标是区分信息“在网络某处可用”与信息“控制生成答案”之间的差别。一个实体信号在被路由到最终标记之前,可以局部可访问。
设计
研究对四个仅解码器模型——Llama-3.2-3B、Llama-3-8B、Qwen2.5-3B 和 Phi-2——在八组受控填空提示族上应用因果激活打补丁(causal activation patching)。其主要的迁移曲线将供体状态(donor state)打补丁到接收者的最终标记状态(receiver’s final-token state)。在主要阈值下,onset 被定义为首次被测试的、连续两层均高于 0.4 的那一层;层的采样为每隔一层取样一次。
关键设计变化是分别对两个位置打补丁:将供体的实体标记状态打入接收者的实体标记状态,以及将供体的最终标记状态打入接收者的最终标记状态。这能将早期实体可用性与后期最终标记承诺区分开来。论文还测试了直接冲突(供体与接收者在关系和实体上均不同)、保留关系但实体错误的供体、以及用关系和实体特定方向向量进行引导(steering)。
发现
在阈值 0.4 下,关系 onset 领先实体 onset 10–16 个被测试层,或占网络深度的 31–44%。该顺序在从 0.2 到 0.5 的阈值范围内对所有 16 个模型–阈值组合都成立。实体信息并非在早期层缺失:在早期和中期层,向实体标记打补丁的成功率为 90–100%,而向最终标记打补丁保持约 2.4%。在后期层,向最终标记打补丁上升到 88–97%,而向实体标记打补丁降至 2–4%。
冲突测试呈现相同的时间模式:关系获胜在中间层占优,实体获胜在后期层占优,且交叉点对于每个模型都在与实体 onset 相差不超过两个被测试层的范围内。错误实体(wrong-entity)对照在关系峰值层进一步报告了 0.79–0.86 的仅关系迁移(relation-only transfer),而供体答案复制(donor-answer copying)保持在或低于 0.11。引导(steering)也将关系效应置于中间层、将实体效应置于后期层。
研究用途与边界
对于新的回忆任务,应将“是否被表征(is represented)”与“是否控制答案(controls the answer)”视为独立假设。构造同关系/不同实体对,分别对实体位置与最终标记位置打补丁,并在将早期信号解释为输出机制之前测试竞争性的关系/实体变更。这些层位点是可干预的假设,而非通用坐标:被评估的模型是权重公开的仅解码器系统,规模在 3B–8B 范围内。实验还使用受控提示和贪心的首次答案生成;自然语言问答、更长上下文和自由形式推理尚未被测试。最后,从实体标记信息到最终标记承诺的路由机制仍需被定位。
阅读此文以获取一个具体的因果测试模式:它将早期信息可用性与后期对输出的控制区分开来,并提供用于测试关系与实体干预的模型特定层范围。
SAE 消融在 Gemma-2-9B 案例研究中将探针读出与行为驱动因素区分开来
线性探针可以表明某一概念是可解码的,但不能表明探针所加权的特征会驱动模型行为。Tiwari 等人在 Gemma-2-9B-Instruct 的指令性真/假(True/False truth)与欺骗设置中测试了这一区别。
用干预测试替代单一排序
作者在第 20 层通过一个 16,384 特征的稀疏自编码器(SAE)对探针进行分解。然后他们构建了两种特征排序:与探针方向的几何对齐,以及模型 True/False 边际的梯度敏感度。作者没有假定高度与探针对齐的特征就一定重要于行为,而是构成了匹配的 Shared、Probe-only 和 Random 集合,并在继续前向传播的同时消融(ablate)它们经 SAE 重构的贡献。输出一致性(output coherence)被用作解释干预的门控条件。[§5.1–5.2; Tables 1–2]
这两种排序并没有很好地识别相同的特征:在报告的规模上它们的重叠约为 11–14%,Spearman ρ=0.10。在欺骗指令评估中,Shared 特征翻转模型 True/False 输出的比例为 13–27%,而等大小的 Probe-only 特征为 6%,Random 特征为 1%;报告的一致性为 1.00。因此论文提供了干预证据,表明与探针对齐的特征可以影响探针自身的读出,但未必是那些对所测行为变化贡献最大的特征之一。[§5.1–5.2; Tables 1–2; Figure 2]
作者还报告称,一种兼顾激活信息的选择方式(将探针信息与特征激活结合)在翻转行为上的效果显著高于仅基于几何对齐的探针特征。他们的解释是受限的:在此设置中,对探针权重向量的激活无关投影不足以识别行为上被使用的特征,但这并不能证明该模式对探针方法普遍成立。[§6]
一个可复用的研究操作
对于探针结果,有用的后续问题是:在将读出分解为可干预的基底后,哪一套匹配特征在输出保持一致的条件下改变目标行为?比较几何排序与行为敏感排序,然后将行为翻转与探针得分的变化分开衡量。在把因果意义赋予 SAE 特征消融之前,还要验证 SAE 是否保留了探针边际(probe margin)。在论文的辅助奖励操纵代码探针检查中,SAE 重构仅保留了原始边际的 26%,因此干预不能被解释为影响了原始探针预测。[Appendix A.2; Table 7]
这些结果集中在一个模型、一层、一个 SAE 与一个行为设置;此外,影响该 True/False 行为的特征并不能单独证明欺骗行为具有普适机制。[§7]
本文提供了一个具体的干预工作流程,用于测试可被探针解码的 SAE 特征是否确实改变探针旨在解释的行为。
Abstract; §5.1–5.2, Tables 1–2; §6–7; Appendix A.2, Table 7
XConf 将检索的分级经历与反思结合以估计 LLM 置信度
Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
XConf 针对现有置信度估计器的一个限制:作者认为它们“仅读取当前推理过程”,通过自省、标记概率或重采样来评估。所提出的替代方法是查询演员模型自身的分级历史,而不是将当前答案视为唯一证据。
经验库存储包含任务、模型在评分前的反思与陈述置信度、结果以及在评分到位后撰写的教训的过去经历。对于新任务,Recall 检索 50 个最近邻经历,使用固定的任务嵌入并通过先前陈述的置信度以及基于正确性的监督重加权来增强。它产出一个历史成功率估计,给与先前置信度相似的邻居更高权重。Reflect 从检索到的经历中呈现短卡片,要求模型识别反复出现的失败模式,并引出一个修订后的 0–100 置信度。最终分数对 Recall 与 Reflect 求平均。这是一个非参数的黑盒程序:不需要访问 logits 或权重更新。
论文在九个基准上评估 XConf,覆盖推理、多模态问答、代码与代理,使用四个模型和五折的样本外银行协议,因此置信度库仅包含先前被评分的经历。作者报告称 XConf“在 24 个模型-数据集比较中有 23 个超越或匹配十样本自一致性(ten-sample self-consistency),且生成成本仅为后者的十分之一。”所报告的比较使用 AUROC 作为判别性指标,ECE 作为校准指标;论文还报告 XConf 显著更低的 ECE。成本条件很重要:XConf 使用一次答案生成加一次简短的 Reflect 调用,而参考的自一致性基线使用十次采样。
一个有用的研究操作是外部记录已评分的回滚(rollouts),然后评估在匹配生成预算下,检索到的历史结果是否能在当前运行仅基线之外改善置信度排序。保持标签来源独立于演员:”银行容忍不精确的结果标签,但不容忍由模型自身产生的标签。”作者报告称,一位独立 LLM 裁判与金标准标签的一致率约为 0.911 时仍保留了方法的大部分价值,而演员自标注会降低性能。
两个边界应当限定复现。作者指出“Voting 在可投票的事实回忆上保留优势”,因此简短事实查询需要一个单独的自一致性对照。作者也未测试演员随时间演化的情形:若演员发生变化,核心问题是旧经历是否仍具预测性或是否需要遗忘与重加权。
学习一个具体的检索-反思置信度门控设计,以用于昂贵的代码或代理回滚评估,包括评估所需的结果标签与任务类型测试。
Abstract; S3.p1; S3.SS3; S3.SS4; Equations (3.3) and (3.4); S5.SS1; Table 3; S6.p6; S7.p1–p3
4B 验证器提高了首个错误定位和测试时轨迹选择
Locating Hidden Failures Makes Long-Horizon Agents More Reliable
长期轨迹代理仍主要以是否最终成功来评判。本文的具体反对点是,终端结果无法显示运行何处出错、是否恢复过来、或在途中发生了何种不可逆的损害。在其安全审计中发现了 65 次不安全行为:每一例均为不必要,97% 在未承认风险的情况下采取,且 75% 为不可逆;审计包含被标为已解决的运行。
有用的方法转变是从仅评判端点——或在早期 ToolPRMBench 工作中按步骤准确性评估工具代理过程——转向明确标注轨迹。人工注释者将每一步标为正确或不正确并标记首个错误。发布的 Traverse 注释将 6,967 次错误分类为 78 类失败类型。这使得验证器的目标成为一个干预点:定位候选运行首次偏离的位置,而不仅仅判断其最终输出是否通过。
基线展示了该目标为何重要。在报道的软件工程与计算机使用测试中,表现最强的评估者定位首个错误的准确率仅为 26.8% 和 32.3%;没有任何评估者超过三分之一,且随着轨迹长度增长准确率下降。作者的 4B 验证器 Scout 在定位失败方面远优于这些评估者,并能迁移到其未见过的领域。用于在测试时从候选运行中选择时,它在不重新训练代理的情况下提高了任务成功率,超过了代理自身的单次尝试表现。
可迁移的研究操作是将代理日志转化为步级监督:标注首个有后果的错误,记录后续动作是修复还是加重该错误,并训练评估器以进行定位而非仅作终端评分。然后将评估器作为候选运行选择器进行测试,同时衡量首错定位与最终任务成功率。这是一个实用的干预点,但证据有其边界:研究覆盖软件工程、终端/计算机使用与 AI-for-science,是否在具身、跨模态或多用户设置下保持仍未明。
阅读此文以学习如何将轨迹日志转换为首个错误标签,并使用专门的验证器进行候选运行选择。
Abstract; S1.p6; S1.p9; S3.SS1.SSS0.Px5.p1; S4.p3 · Table 2 (S4.T2 rows for Tool-using PRMs and overall table)
实测 HQQ 3 位质量损失因领域与模型而异
A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality
测量问题
Kaplan 阐明了推理优化研究中的一个实际限制:量化、提前退出与预测性解码(speculative decoding)通常用各自的基准分数评估,而不是用一个校准过的度量来比较各种技术带来的质量成本。
仪器的改变
论文使用了一个 LLM 评判者,但首先测量该评判者是否能将变化与普通采样变异区分开来。对于每个提示,它抽取两个独立的 bf16 参考回复;它们的评判差异构成可交换性(exchangeability)虚无假设。它还包括一个实现空假设:严格的预测性解码,使用一个 4-bit drafter,规定其在分布上与未修改模型相同。研究加入了正控并预注册了在七点量表上的 ±0.3-point 等价界限。
在五个领域共 220 个提示上,观察到的参考-参考差异为 −0.05,95% 区间为 [−0.18, +0.08]。其每提示的标准差为 0.94。这些检查为等价主张提供了操作性含义:一个优化臂必须落入预设容差之内,而空臂表明管线并未引入可检测的明显损失。
它测量了什么
对于 Qwen2.5-7B-Instruct,4-bit NF4 量化和宽松的预测性解码在该 ±0.3 界限下与 bf16 模型等价。相比之下,HQQ 3-bit 量化的合并判定质量损失为 −0.70,在难以验证条目的最大报告损失为 −1.11。在 Llama-3.1-8B-Instruct 的复现中,保留了 NF4 的合并等价结果,但 HQQ 3-bit 明显更差:合并为 −1.84,代码域为 −3.11,而算术域报导几乎不变为 −0.09。因此在该协议下所报告的幅度取决于目标模型与提示领域。
一个有用的研究操作直接总结为:在从聚合分数中选择一种优化之前,先测量一个保持分布的空假设、包含一个刻意可检测的对照、在相同提示上配对优化与参考输出,并询问哪些部署领域有足够样本以达到期望的等价分辨率。
边界
这些结果来自一类主要评判标准与两个 7–8B 的目标模型。作者声明另一种评判量表或成对协议可能会以不同方式解决比较,且测得幅度不会迁移到更大的模型。按领域的结论在方差高的地方也不够精确:难以验证领域的配对标准差接近 2.0,需要更多提示以获得精确的等价判定。
阅读此文以在声称某项推理优化在特定部署领域保持输出质量之前,采用一个具体的空假设与正控协议。
