迁移博弈将 grokking 定位为分布式的傅里叶重编码,而非模块切换
Where Grokking Happens: Distributed Utility and Fourier Recoding Without a Module Switch
Power 等人记录到 grokking 是这样的现象:在训练准确率已接近完美之后,验证准确率仍从随机水平上升到接近完美的泛化。本文把“时序”问题转为“定位”问题:记忆到泛化的功能性变化在哪里表达?
一个先前的结构性解释给出有用的边界:在 Decoupled Max-Margin Assumption 之下,其定理研究了一个最小的单层、单头 Transformer(带固定 query),并要求同时满足注意力的结构条件和 MLP 范数条件以获得零测试误差。因此其适用范围比本文考察的两个 block 的激活层级设置更窄。
在本文中,作者把“transition”本身作为估计量。Transition Games 在每个随机种子内配对:将最后一个由记忆主导的检查点与第一个持久泛化的检查点配对,用训练集均值(主要)、零值或保持边际分布的 donor 替换不活跃激活,并穷尽精确地计算被裁剪预测压缩的 Shapley/Owen 分配。匹配的非泛化对照把单次运行内的变化变成受控的收益(gain),而非简单的快照比较。
主要结果是效用分布式且带有 block-0 的注意力偏置:在均值替换的受控收益中,注意力超过相邻的 MLP 每个示例 0.1874 bits(95% CI [0.1322, 0.2425]; 12/12; exact p=.000488)。那种更尖锐的“MLP 记忆、注意力 泛化”的交接在严格的记忆锚点处发生反转:MLP-minus-attention 的训练效用为 −0.3314 bits/example,且在配对中有 0/12 对朝预测方向。以上是在声明的配对协议和小模型任务族下得到的结果,而非普适性架构法则。
所提出的机制比“模块切换”更具体。五 个选定的非 DC 的二阶嵌入频率贡献了 0.5214,对比残差为 0.1406——占聚合对比的 78.8%;改为零替换时为 91.5%。在一个不相交的精确 16-coalition 恢复博弈中,block-1 的 MLP 获得 2.6440 bits,并超出其它测试路径合计 2.5167 bits,且在 12/12 对中成立。因此,在该干预范畴内,证据指向与任务对齐的谱(spectral)重编码,而所选的 block-0 效果主要通过下游的下一个 MLP 得以表达。
可复用的操作流程是:配对迁移检查点、保留匹配对照、将效用分解为与任务相关的模态,然后恢复候选的下游路径。应把输出解释为在声明博弈中的一种分配,而非唯一的参数存储:激活替换与傅里叶投影会创造混合的反事实,donor 干预保持边际而非联合依赖,探针(probes)仍属于关联性证据。复现工作应测试非绑定的读出、更稠密的检查点、另一种操作、受控的第三个 prime、更大网格以及自然语言模型;论文报告了对 prime 与效用敏感的发现,并将这些扩展作为开放问题。
学习一个具体的检查点配对与干预协议,以检验 grokking 迁移是否反映组件替换、谱重编码或下游路径调解。
来源位置
证据屏蔽在四单元社会中使预注册的组合泛化测试通过
问题与先前限制
论文询问:阻止一个模块读取外来证据槽是否能改善一个通信社会的留出组合泛化?确认实验使用 60 个四单元(four-cell)系统,它们共享一个冻结的语言模型骨干并学习连续的数据包。五种条件在六个初始化簇和两个数据顺序上、在一个新的任务世界中,变动了证据屏蔽、所有权标记和中性填充。
一项早期的配对研究发现了掩蔽对比全局可见的大优势,但其预注册的合取条件形式上失败了,因为受限臂的深度三中位准确率为 0.6988 而非 0.70 的下限。该干预还将阻止外来证据与角色/所有权信息和主动上下文负载减少耦合在一起,因而归因仍未解决。
决定性结果
当两种机制均可使用标记时,掩蔽(R+)相较带标记的全局机制(G+)在配对后的中位差为:深度二为 0.846,深度三为 0.859;全部十二对均超过了所需边际,且完整的预注册行为准则通过。在受掩蔽的系统内,所有权标记几乎是多余的:R+ 与 R− 在两个深度上的中位带符号差恰为 0.000,且全部十二对轨迹均在预注册容差内。
然而,没有任何 G+ 轨迹通过必须的标记遵循检测,因此在全局可见的机制中并未证明所提供标记能提供可用的角色信息。作者提醒这并不排除角色信息的解释,因为标记操纵在训练期间较薄弱且在位置上冗余。
机制边界
对全部十八条被审计的受掩蔽轨迹进行的数据包(packet)干预显示,在有资格的样本上同值保持与反事实跟随为 1.000,意味着替换在受掩蔽的接收方上产生了预期的中间值变化。这些审计是以成功为条件且覆盖有限;它们并不建立掩蔽优势的中介关系。
一个具体的后续是用打乱槽位(shuffled-slot)标记设计重复配对的 R+/G+ 比较,保持任务与训练预算不变,询问当位置不再提供角色线索时掩蔽优势是否仍然存在。论文明确指出,在就角色信息本身做任何主张前,需要进行打乱槽位的设计。
结论需受限:中继拓扑、归一化的数据包锚点和单例/转发的课程搭建了任务;这并不是在无该支架下检验组合性自发出现。论文还报告主要结果在 cohort 训练完成之前就可用,因此结果在修正与裁决之前曾被检查过。
阅读本文以复制一个配对的掩蔽-对比-全局的比较与标记对照,在把数据包干预视为机制证据之前先进行谨慎检验。
来源位置
EDCT 将视觉语言模型自身的解释转化为可验证的反事实测试
EDCT-Bench: Uncovering Faithfulness Gaps in VLMs via Explanation-Driven Counterfactual Testing
视觉语言模型(VLM)可以生成听起来合理但与其引用的视觉证据不一致的自然语言解释(NLE)。EDCT 的设计目的是将该失败在行为上进行测试:它编辑被解释中引用的证据,然后询问答案与解释在编辑后的图像上是否仍与之保持一致。CF-VLM 将反事实表述为带有三种损失的微调目标,而 EDCT 则将其构造成一个行为测试。具体变化是把模型陈述的证据视为可检验的承诺,而不仅仅是用于判断合理性的文本。
流程先为一个图像-问题对获取答案与解释。一个 LLM 提取解释中引用的视觉概念,系统使用图像编辑器(如 FLUX.2 和 Gemini Image)为这些概念生成最小定位的编辑。随后用检测器-分割检查、ORB 加光流的对齐,以及像素或结构差异门控验证编辑的局部性与语义有效性。模型在编辑后的图像上被再次查询,并由 LLM 判官对答案一致性与解释忠实度评分,生成反事实一致性得分(Counterfactual Consistency Score,CCS)。实验在每个样本上使用最多两个被引用概念。
EDCT-Bench 覆盖了知识密集型的 OK-VQA、与安全相关的 DriveLM 以及 3D 空间推理任务 3DSRBench。在评估的 VLM 中,Gemini 2.5 Flash 表现最好但二元 CCS 仅约 0.600,分级 CCS 为 0.603;其他模型的二元 CCS 在 0.435 到 0.566 之间。在一个人工验证子集上,EDCT 与注释者的共有标签在 88 个案例中匹配了 83 个,即 94.3%。一个小规模训练试验也给出一个可用的数据选择假说:在 48 个 DriveLM 车轴计数样本上,Qwen3-VL-8B 在原始样本上得分 69.0% 而在反事实上为 34.5%,初始损失分别为 0.1792 与 0.7124。
将这些结果解释为行为证据,而非内部推理的直接读出。作者声明 EDCT 并不恢复内部因果机制,且一次通过并不能证明解释反映了这样的机制。困难程度在模型间并不一致,因为干预来自模型特定的解释;自动评分依赖于编辑器、验证器与判官的配置。48 样本的训练结果仍然是初步的,并不证明在留出集上忠实度得到了提高。因此一个可复用的实验流程是:生成针对解释的编辑、审核每个验证门、报告组件配置,并在声称训练收益前评估微调后在留出干预上的 CCS。
学习如何把 VLM 自身的理由转化为可证伪的干预,同时在保留自动分数与初步训练信号的前提下对结果进行适当限定。
来源位置
连续的编辑局部窗口修复相邻的陈旧 KV 缓存
Contiguity, Not Importance: Budgeted Repair of Stale KV Caches After Document Edits
限制与变化
在因果自注意力(causal self-attention)下,文档的局部编辑可能影响下游的 KV 状态;仅刷新被编辑的跨度可能会使下游依赖变得陈旧,而完整的重新预填充(re-prefill)尽管代价更高却能可靠恢复一致性。先前工作将此失败具体化:在覆盖改变字段自己的 key/value 向量同时重用其余部分,会导致模型仍基于旧值行动。
本文将就地修复表述为有预算的重算问题,并比较无需训练的位置选择策略。每种评估的修复都会重算被编辑的跨度,然后选择下游位置;EditLocal 选择紧随编辑的 K 个位置。主要比较使用 K=32,匹配的直接与派生事实性编辑,以及 Llama-3.1-8B-Instruct、Qwen3-8B 和 Mistral-7B。直接情形由所有策略修复;派生情形则揭示差异。
在该主要预算下,当承载答案的依赖文本仍与编辑相邻时,EditLocal 恢复了至少 0.94 的编辑后答案余量(post-edit answer margin),显著优于基于注意力、KV-偏差和结构选择器,并能翻转大多数留出派生项。论文还报告该修复比全量 re-prefill 快 13–21 倍。作者的机械性解释关于执行顺序:一个连续窗口重建了前向的依赖链,而分散重算的位置会读取周围的陈旧状态。这就是为什么在干净状态移植诊断下看上去因果信息丰富的位置集,不一定是良好的稀疏重算方案。
边界是明确的。当把承载答案的文本下移到 d≥250 tokens 时,在 K=32 下 EditLocal 的 MR 大致坍缩到 0.01–0.09;有时陈旧查询的注意力反而有帮助,尤其是在 Llama 上。因此一个实用的复现是:在固定重算预算下扫描依赖距离,并将移植诊断与实际重算比较,而不要将前者视为操作算子。移植面板自身使用了 15 个开发项并省略了 Mistral,因此该诊断支持该机制但未完全验证它。
推荐是有条件的、非普适的:当依赖文本保持相邻时,先从 EditLocal 开始。该研究覆盖了单一连续、长度保持的编辑;使用了接近 8B 的密集模型与单 GPU、批次为 1 的计时,并未测试多编辑或长度变化的更新、更大或稀疏模型,或生产服务中的情形。
用本文来选择一个首选的修复基线,并在实现更复杂的 KV-cache 选择或编辑方法前设计一个控距测试。
来源位置
仅成功重评分在离线蒸馏中对教师失败轨迹重新加权
Trajectory Learnability for Offline On-Policy Distillation with Imperfect Teachers
离线的 on-policy 蒸馏(offline on-policy distillation)重用存储的学生轨迹和教师监督,但这种重用也使不完美的监督变得持久。教师失败的问题因此是粗糙的信号:并非其学生轨迹上的每个标记都必然无益。重复基于续写的可恢复性估计可以提供更丰富的信号,但它们在很大程度上丧失了离线重用的效率优势。
Learnability-Weighted Distillation(LWD)仅在教师成功的问题上训练一个辅助参考模型 π₊,然后用 π₊ 与原始 rollout 策略 ρ 对教师失败问题中存储的标记重新计分。对于每个观测到的标记,learnability 信号为有符号对数似然变化:log π₊(aᵢ,ₜ|sᵢ,ₜ) − log ρ(aᵢ,ₜ|sᵢ,ₜ)。正值意味着仅在成功样本上学习更强烈地提升了观测到的学生行为。论文将该信号裁剪到 [-4, 4] 并用 33-token 的移动平均平滑后再对轨迹进行汇总。
随后 LWD 使用轨迹级汇总将失败轨迹分配到低、中、高 learnability 级别,并对原始的离线 OPD 损失施加有界的正权重。教师成功的记录保持权重 1,而失败记录获得减弱但非零的权重;轨迹内的标记级教师目标被保留不变。这是一个选择性保留操作,而非对教师目标的替换。
决定性的消融实验偏向分级保留:对教师失败监督减权比完全保留或彻底移除更优,且基于 learnability 的轨迹特异性加权总体上表现最佳。在报道的 Qwen3-8B 到 Qwen3-4B 的设置中,LWD 在五个基准上均优于协议匹配的离线 Lightning-OPD 基线:AIME24 +2.7 点,AIME25 +2.0,HMMT25 +1.6,LiveCodeBench v5 +1.9,LiveCodeBench v6 +1.7。AIME24 从 66.4 上升到 69.1 avg@32。按论文的核算,LWD 使用了 2 GPUs 和 21.90 GPU hours,而代表性的在线选择性 OPD 方法使用了 3 GPUs 和 36.28–47.69 GPU hours。
边界很重要:learnability 信号不是正确性标签,也不估计教师目标在某一状态下的效用;它衡量的是观测行为对仅在成功样本上学习的响应程度。对于代码问题,可用的教师成功标签通过正常终止并严格提取完整 Python 程序来近似格式有效性,而非功能正确性。因此一个实用的复现应记录标记级的变化再进行聚合,然后在改变仅成功更新的预算、平滑窗口和级阈值时测试分层权重是否仍有用。中心研究问题是:这种响应性信号是否提供了超出简单与奖励对齐的过滤以外的信息。
阅读此文以评估一次仅在成功样本上进行的辅助蒸馏是否能在不放弃离线训练效率的前提下,拯救部分有用的失败回放。