在冻结与刷新推演下,OPD 提示广度产生相反影响
Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation
本文将提示库大小与推演刷新视为在在策略蒸馏(OPD)中的联合控制变量。早期一次性 OPD 工作报告称,单个查询的推演在第 300 步时覆盖了参考全量数据状态空间的 71.5%,而 16 个语义上不同的查询在覆盖率上约为 98.9% 并匹配全量数据 OPD 的表现。早期证据关注查询多样性与状态覆盖;本文则将推演刷新作为第二个控制变量。
为检验交互作用,实验采用一个 3×3 的数学推理设计:固定 14,080 条轨迹和 110 次优化器更新,同时改变提示库和用于产出响应的策略快照数。匹配的 48 提示实验用 macro3 平均准确率、pass@32 和可解析分数比较周期性与冻结的响应生成。
核心结果颠倒了“更多提示有益”的常规解释:在响应以初始策略冻结时,增加提示广度会使平均准确率从 21.16% 降到 19.05%;而在每次更新后刷新响应时,广度使准确率从 23.61% 提升到 25.57%。交互效应为 4.07 个百分点,带有 95% 问题配对区间 [2.00, 6.28]。然而当响应刷新时,广度并非总是必须的:在十 个快照设置下,八 个提示可达到 24.09% 的平均准确率,接近 14,080 个不同提示的 24.51%。
刷新还改变了模型在推理时的产出。在匹配的 48 提示实验中,与冻结响应相比,周期性响应生成显著提高了抽样覆盖率和可解析性:在 Qwen3 教师下,pass@32 上升了 12.69 个百分点,可解析性上升了 40.15 个百分点。在较短的输出预算下,周期性模型具有更高的准确率和答案完成性,但在 32K 输出限制下冻结响应模型在平均准确率上反超,同时使用了 1.7–1.8× 更多的响应标记。
后续建议是在扩展 OPD 之前先运行一个小的广度×刷新矩阵:固定轨迹和优化器更新,一起检查准确率、pass@32、可解析性和响应标记,然后跨随机种子重复单元并加入按标记数匹配的比较。该结果应被视为经过检验的交互作用,而非普适规则。结果基于单一学生模型和一个数学基准套件测量;每个主网格单元是一次训练运行,且尽管轨迹和优化器更新匹配,不同单元的响应长度——因此标记层面的计算——仍然不同。
为学习如何设计一个小型 OPD 试点,在提交更大训练运行之前将提示多样性与推演新鲜度分离开来进行测试。
来源位置
ToolCompass 通过塑造函数级表示来引导对未见工具的试验
Toolcompass: Guiding Tool Trialing, Not Suppressing It
使用工具的大型语言模型代理面临一个试验问题:过多的试验会浪费交互预算,而选择性试验能在熟悉度不足的工具上实现探索。现有的基于结果的后训练方法让浪费性试验缺乏指导,而逐回合监督又可能抑制必要的探索。
ToolCompass 将每个函数类在单位超球面上建模为 von Mises–Fisher(vMF)方向分布,使得实现相同函数的调用(即便跨域)被驱动向共享的原型方向靠拢。这一结构把已见工具的经验迁移到功能相似的未见工具上,将探索引导离开不相关的替代选项。ToolCompass 仅在后训练阶段需要已见工具的函数类标签;它不需要逐步的真实调用轨迹、对未见工具的访问或额外的冻结逐回合评分器。该框架在推理时不增加开销。
在多种宿主后训练目标(GRPO/RFT/DMPO)和 两个 模型规模上,加入 ToolCompass 均带来一致增益;报告的增益包括在 Qwen3.5-4B 上对 AppWorld/FTRL 使用 GRPO 时,整体分数上分别为 +9.18/+10.79 个百分点。
调用分析为该机制提供了行为学检验。ToolCompass 在减少无效工具调用的同时保留或增加了有用的试验:它的总调用平均为 26.51 次,而 vanilla GRPO 为 31.55 次;有用试验平均为 12.61 次,而 vanilla 为 10.47 次;无效试验平均为 4.07 次,而 vanilla 为 12.75 次。因此在该设置下,减少并不仅仅是调用总数的减少:有用试验被保留,同时无效试验显著下降。
实践边界很明确:需要已见工具的函数类标签,尽管不需要调用轨迹或对未见工具的访问。这里报告的基准是 AppWorld 和 FTRL。将结果推广到这些设置之外应视为后续检验,而非本文已确立的结论。
一个有用的研究操作是:在固定已见/未见划分的情况下,用和不用表征损失训练同一个宿主目标,分别记录总调用、有用调用与无效调用,然后扰动函数标签与原型更新设置。要带入的问题很具体:OOD 的改进能否在函数几何不完美时仍然存在,还是依赖于干净的标签与稳定的原型更新?该实验直接检验所提议的迁移机制,而不是仅仅使用总体成功率。
为研究一种仅在训练阶段加入的表征损失,该损失改变有用试验与无效试验的计数,并复用其记录设置以测试你自己的函数标签是否能迁移到未见工具上而阅读此文。
来源位置
终端收缩平均揭示了 LLM 预训练中调度与估计器的相互作用
Terminal Shrinkage Averaging Reveals a Schedule-Estimator Interaction in LLM Pretraining
LLM 预训练通常返回原始的最终迭代参数。这把两个设计选择耦合在一起:产生参数轨迹的学习率调度,以及构造部署模型的估计器(例如原始最终迭代或检查点平均)。这正是 TSA 要解决的具体限制:如果部署模型是平均的,仅评估原始最终迭代会将调度质量与估计器选择纠缠在一起。
TSA 在原始最终迭代与最近检查点平均之间插值,以在近期进展与末端波动之间取得平衡。在局部二次近似下,TSA 的期望超额风险是 α 的显式凸二次函数,其解为 α* = Π_[0,1]((⟨m,A⟩_H − C)/(‖A‖_H^2 + V_q)),当分母为正时。对于固定的已保存轨迹,这使得估计器选择成为一个小规模的事后扫参而非一次新的训练运行,同时保留偏差-方差视角来解释结果。
决定性的受控结果是条件性的而非普适的。depth-12 NanoChat 的确认实验使用了 5% 的末端学习率下限、 五 对配对轨迹,以及 K=8、间隔 32 步的 TSA 最近检查点平均。在 depth-12 NanoChat 且末端下限为 5% 的设置中,部分收缩(例如 α≈0.40–0.55)可靠地在验证 BPB 上优于原始最终迭代,而完全均匀平均(LAWA,α=1)可能会使 BPB 恶化。所选配方也能方向性地迁移:在 depth-22 NanoChat 匹配端点的运行( 三 个种子)中,加入 15% 的末端下限与 TSA(α=0.70,K=8)相对于校准基线产生了小但一致的 BPB 改进;CORE 资格在 三 个种子中获得 其中 一 个,因此速通结果是初步的。
一个有用的复现操作是:固定训练轨迹和留出评估批次,保存最后 八 个检查点,比较 α=0、一个内部值和 α=1 在若干末端学习率下限上的表现。要记录的问题不是简单哪个下限胜出,而是胜出的下限是否会随返回的估计器改变。
这不是一个普适的调度规律。理论依赖于为了解释训练后期行为而用的局部二次替代;它并不声称对神经网络优化的全局刻画。实证结果仅限于 NanoChat(depth-12 的受控实验与 depth-22 的初步迁移);外部泛化尚未确立。平均也带来内存/存储成本;论文指出了异质性并给出缓解措施,但并未消除资源顾虑。
在改变末端学习率下限的同时,对最近检查点收缩做一个事后小扫参,以便在你实际要部署的估计器上评估调度调优。
来源位置
LEMA 将精确二值匹配转为字典支持的 Transformer 记忆
LEMA 改变了检索原语:每个头按坐标逐位对查询和键进行二值化,然后返回与最近的此前键完全匹配的值。在推理时,一个头的键-值状态可存为主内存字典:每个标记需要 一次 查找和 一次 插入,已有键会覆盖其旧值。训练使用二值化的直通估计器(straight-through estimator)和向 LEMA 硬化的软注意力替代物,因为硬操作不可微。
在关联记忆设置中该架构权衡可见:LEMA 使用增长的状态,而门控 DeltaNet(GDN)在评估中使用固定大小状态。在理论方面,定理 1 构造了一个带有思路链(chain-of-thought)的 LEMA 变换器,能模拟具有每步 O(w) 时间膨胀的 word-RAM,并产生 O(s_M(x)+w) 个不同键。相反,定理 2 给出一个 word-RAM,能够自回归地生成任意 LEMA 变换器,每处理一个标记需要 O(N) 的工作,空间随不同键数和头维增长。
在受控的合成关联记忆任务上,采用替代与硬化程序训练的 LEMA 比固定状态的 GDN 存储和回忆出更多关联。扩展实验到 834 million 参数规模时,报告的交叉熵可与参数约为其一半的 softmax 变换器相当。论文还指出,LEMA 在重复稀有短语和“针式”检索任务上仍落后于 softmax 变换器,但在可比 GDN 模型之上能跨更长距离回忆。
推理结果伴随一个系统条件:基于主内存开放寻址哈希表的实现能在表接近容量之前提供近常数的每标记生成时间,与 GDN 可比。训练边界另成一事:所提替代仍需在序列长度上做二次计算,因此论文并未给出一个亚二次的训练算法。
一个有用的复现问题是:当参数量、上下文分布与哈希表占用率一并受控时,检索优势是否仍然存在——对上下文距离与哈希表负载做扫参,在匹配损失下比较 LEMA、固定状态 GDN 与 softmax,并同时报告回忆率与训练及生成成本。
我阅读此文以检验用精确二值匹配替代相似度查找,是否能在不放弃受控和语言模型任务回忆能力的同时,支持增长的主内存状态和与上下文长度无关的每标记推理开销。
来源位置
CPZ 传播将单输入注意力发现提升为有界邻域证书
Certified Mechanistic Interpretability: Lifting Single-Input Findings to Bounded Neighbourhoods
机械可解释性逐输入逆向工程变换器电路,因而观察到的机制在有界输入邻域上缺乏保证。本文通过将观察提升为对有界扰动集合的证书性陈述来弥补该空白。目标是内部注意力:经证书的查询为 top-k 稳定性、evidence mass(证据质量)和注意力熵。
方法使用受限多项式 zonotope(CPZ)表示有界嵌入空间扰动集合,沿变换器块传播这些 CPZ,并将三类注意力查询表述为在 softmax 权重单纯形上的可处理规划。其核心代数手法是在 CPZ 代数下保留精确的 Q^{\top}K 双线性结构,避免区间式处理丢弃共享的多项式依赖。这种精确性是有条件的:所给结果在 Q^{\top}K 之前没有 LayerNorm 时保证仿射与双线性精确性。在相关约束点,CPZ 传播在 mergeID 对齐后精确保持 softmax 单纯形和 LayerNorm 的零均值恒等。为了解决深度问题,递归的雅可比-zonotope 构造在输入处线性化块堆栈,避免按层生成器数量增长。
决定性证据是对 degree-2 CPZ 多项式的一个有界但不总是紧的闭式上界。在所述的 post-LN Layer-0 设置中,该上界支撑一个无需优化的 top-1 证书。因此,读者可以执行一个具体的研究操作:当在某个提示上观察到某个注意力头的解释时,定义一个有界嵌入空间邻域,将该主张表述为经证书的注意力查询,并报告所得上界是否在该邻域内保持该主张,而不是仅依赖原始示例。
边界很重要。文中明确说明离散 token 替换和反事实分析不在处理范围;该方法仅处理连续嵌入空间扰动。因此,正向证书应被解读为在所指定连续邻域内的鲁棒性,而不是 token 级别的保证。二次上界也可能较松,所以“经证书”仅表明所陈述上界的可靠性,而不必然等同于对可达注意力行为的最紧描述。
我阅读此文以学习如何把在单个提示上观察到的注意力头主张,转化为在指定嵌入空间邻域上的最坏情况检验。