2026-09-23
2026-09-23
TreeSpark 将半自回归草稿树规模转化为经过校准、负载自适应的服务决策
TreeSpark: Calibrated, Load-Adaptive Draft Trees for Semi-Autoregressive Speculative Decoding
局限。 固定大小草稿树在分配验证容量时没有考虑解码回合或当前服务负载能够支撑多少推测。TreeSpark 还指出了一个评分问题:在所评估的 DSpark 移植实现上,按位置的边际评分可能使分支错排,并即便在显著更大的验证预算下也不如链式(chain)。
方法变化。 TreeSpark 不再按位置独立对孩子排序,而是从半自回归草稿器现有的马尔可夫头读取以父节点为条件的分布,而无需另一次主干传递。它用一个二参数 Platt 映射将贪婪子节点的条件概率 q₀ 映射为估计的边接受概率:p̂(edge) = σ(a · logit(q₀) + b),在报告的 Qwen3-4B 校准中使用 a = 0.67 和 b = −0.46。随后以最佳优先扩展优先考虑沿每条路径的估计边概率乘积。一个运行时价格 θ 在最佳剩余路径的存活概率不再值得其验证成本时停止扩展。
对于采样解码,兄弟节点在无放回的情况下被抽取,并使用递归拒绝抽样进行验证。在论文的运行条件下——每个槽在其令牌被观测前即被接纳,且抽取结果既不被丢弃也不按值重排序——该程序旨在保留目标分布,而不是以无损性为代价换取树的多样性。
证据。 在使用 block-7 草稿器的 Qwen3-4B/8B/14B 上的贪婪评估中,以父节点为条件的树在每个匹配的验证预算下都优于按边际的 DDTree 评分。校准的停止策略在每个报告的运行点上均比最近的固定预算提高了被接受长度和降低了验证成本。在最终的重算实现中,Qwen3-4B 在报告的温度范围内被接受长度提高了 15–25%,并比链式运行快 8–14%。
研究操作。 一个有用的复现方法是仅在对树增长重要的群体上校准边的存活——即那些祖先已经存活的边——然后在相同的验证器成本下比较固定预算扫描与一组 θ 梯度的表现。在解释自适应收益前,按温度和模型规模分别测量校准。
最强的边界是服务现实性:墙钟时间测量使用的是 Python 研究框架和单个请求,而非连续批处理实现,因此生产吞吐、尾延迟和高并发行为仍未被测量。发布的设置还使用了 block length 7 和即时父节点马尔可夫条件。最后,校准标签来自贪婪匹配,而非零温度的验证使用递归拒绝;作者报告了这种不匹配但未在实验上孤立其影响。
阅读此文以获得将单次通行半自回归草稿器转换为自适应树的具体配方:以父为条件的评分、存活校准、无损的兄弟采样以及运行时停止价格。
一个离线预言器发现了针对 MoE 推测的序列条件上限
The Limits of Speculation: Bounding Speculative Decoding in Mixture-of-Experts
局限
论文针对一个具体的 MoE 特有局限:验证成本不稳定,因为被加载的专家取决于输入。因此其设计将推测性解码视为有代价的决策:一个候选只有在其预期进展能够证明它引发的目标端验证工作是值得时才有价值。
方法变化
对于已知的参考序列,作者将推测预算选择表述为一个离线随机最短路(Stochastic Shortest Path)问题。其“序列条件离线预言器”基于参考上的草稿模型代理概率估计转移概率,反事实地模拟“垃圾后缀”以测量候选续写的专家并集计数,将这些计数用经校准的回归转换为目标端通过时间,并通过向后归纳求解贝尔曼方程以选择局部推测预算和端到端时间上界。反事实后缀旨在估计错误令牌的代价而不扰动参考轨迹。
决定性证据
在 SpecBench 的数学推理子集(由 80 个问题组成)上,报告的设置使用 Qwen3-Coder-30B-A3B-Instruct 作为目标模型、EAGLE-3/SGLang 作为草稿模型、one NVIDIA A100、batch size 1,以及 L_{max} 扫掠到 12。超过 L_{max}=6 后,报告的预言器加速在大约 2.34× 处趋于平稳,平均被接受批长度约为 2.1 个令牌。在 Delta 空间中,论文报告被拒绝的候选选择沿着预期边际成本与预期边际进展的严格线性边界排列。作者将此模式解释为局部决策规则:当某一额外推测步骤的边际成本与边际进展之比低于阈值时接受该步骤。
研究用途
将预言器视为校准工具,而非在线策略或通用上限。作者声明其边界仅适用于重现固定参考文本,并忽略其他有效续写。定量结果也仅限于一对目标/草稿配对、batch size 1 和特定硬件/软件环境;成本估计使用草稿置信度代理和单次蒙特卡洛垃圾尾采样,导致局部噪声。一个实用的后续是跨多个参考、不同批次大小和模型对重跑预言器,然后在引入更复杂的草稿结构前测试轻量级的边际成本比率是否能再现其预算选择。
阅读此文以了解如何把 MoE 专家加载轨迹变成离线预算选择基准,然后在设计在线推测性解码启发式之前进行校准。
MoE 路由器训练增加了用于推测性解码的专家共激活
Efficient Mixture-of-Experts with Speculative Decoding via Expert Coactivation
瓶颈
推测性解码(SD)在 MoE 推理中暴露了一个系统成本:验证更多令牌会激活更多不同的专家,因而需要将更多专家权重从 DRAM 转移到 NPU。论文报告指出,SD 给密集模型带来了显著的吞吐提升,但对基线 MoE 的提升较小。更大的验证窗口会增加不同激活专家的数量和 DRAM 到 NPU 的通信,而测得的 MoE FFN 基准显示运行时大致随激活专家数线性增加。这将路由器行为框定为性能问题的一部分。
训练变化
论文并未改变推断时的 SD 算法或草稿模型,而是在训练时通过四项干预改变路由器行为:全局而非局部的负载平衡损失、专家共享、邻近令牌一致性损失,以及在每个验证窗口内的自回归专家选择。该选择过程保留了上一令牌的一些专家,仅添加有限数量的新专家,鼓励邻近令牌重用专家。预期的系统效应是增强的专家共激活,使得一个验证窗口需要转移的不同专家更少。
组合设计产生了论文的主要结果:在保持相当准确度的同时,报告比 MoE 基线提高了 21% 的吞吐率。实验使用每个令牌四个路由专家、总计 16 个专家的模型,跨多个数据集和任务进行评估;模型在相同超参数下从零开始训练,并在不同的 SD 窗口大小和任务特定接受率下测量吞吐率。
边界与研究用途
全局负载平衡增加了节点间通信;作者报告在他们的设置中这并未成为训练瓶颈。被评估的模型在特定硬件和实验配置下用六 trillion tokens 训练,因此所给证据不能证明吞吐或准确度结果可迁移到其他规模、内存带宽环境或部署约束。
一个有用的复现是逐项进行单干预消融,同时逐层记录被转移的不同专家数、DRAM 到 NPU 的时间、接受率和端到端吞吐,然后在具有不同内存带宽的硬件上重复比较。这可以检验共激活本身是否能预测收益,而不是把报告的 21% 视为可移植常数。
阅读它以学习如何测量每个 SD 验证窗口的不同专家数,并在将该统计量转化为路由器训练实验之前验证它是否能解释端到端吞吐提升。
LLM 的心理学效应分为标签、知识和安全路径
一个 LLM 可以产出与人类心理学效应相关的响应模式,但该输出并不证明它确实具有该偏见。PsyAgentBench 以一个析因基准将该区别操作化:交叉显式范式命名(命名与盲测)、教科书式与结构匹配的反事实内容,以及角色(persona)操纵。跨五个完成的范式,它发布了 41,904 次试验并报告复制曲线而非单一的偏见易感度标量。因此该设计检验了一个表面效应是否能在标注、刺激构造和提示上存活。
此前,“noto” 检查将多项选择题的正确选项替换为字面上的 “None of the other answers”,因此解题需要拒绝所有其他选项。其作者也指出多项选择评估无法全面评估推理能力。PsyAgentBench 则在旨在分离范式识别、刺激重叠和提示驱动行为的控制下重跑经典心理学实验。
决定性证据是异质的。对于 gpt-oss-120B 在典型 Asch 题目上,命名条件下的从众率为 83.3% 而盲测为 0%(n = 120 per cell)。在锚定实验中,同一模型在有依据的典型题上指数为 0.000,但在发明的量上中位数大约为 0.90–1.01;命名并未降低该现象。在无角色提示时,框架效应在盲测提示中接近零而在命名时显著,命名-反事实单元大于命名-典型;每个领域当前都使用一个场景对。沉没成本在所有测试单元中实际为零。在最小群体分配中,明确拒绝是主要的经验现象。这些结果支持作者的解释:类人输出是通过不同路径产生的,而非单一的通用易感性。
针对新的代理行为主张,请在贴上人类心理学标签前先运行析因控制:比较命名与盲测提示、典型与反事实刺激、以及角色变体,同时将拒绝视为一种结果。不要将角色结果视为稳定特质的证据:一句话的宜人性操纵被表述为指令,其措辞与结果存在重叠,且计划中的行为表述消融尚未运行。反事实状态是一个设计目标,而非验证过训练数据中不存在;放大检测(amplification)可以排除逐字记忆,但不能排除结构性记忆。最后,经过拒绝过滤的偏袒指数会受到选择偏差,并且所有实验均使用了一个提供者且未经试点的温度为 0.7。
阅读此文以学习一个可复用的析因测试,用于在将心理学基准结果解读为代理层面效应前,区分被记忆或由提示触发的行为与更稳定的代理效应。
abstract; Abstract; Section 4.1; Table 2 (PDF pages 1, 6-7); Abstract; Section 4.2; Table 4 (PDF pages 1, 7-8); Abstract; Section 4.3; Table 5 (PDF pages 1, 7-8); Section 4.4; Table 6 (PDF pages 8-9); Section 4.5; Table 7 (PDF pages 8-9); Abstract; Sections 4.1–4.5; Section 5.1 (PDF pages 1, 6-9, 10-11); Section 6 Limitations (PDF page 11); Section 6 Limitations; Section 4.5 (PDF pages 8-11) · S3.p1; Sx1.p1
当错误相关时,十个 LLM 评审大约只能提供 3.5 个独立评审
Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus
共识常被视为决策正确的有力证据,但这种解释假定评审的错误彼此独立。论文针对的是相似评审重复相同错误的失效模式。论文提出的协议使用受信任示例来估计评审准确性、识别共享错误,并在应用到新数据前选择聚合规则。
对于主要的开源评审库,作者构造了十个逻辑评审并在 1,133 个按列表完整的 RewardBench 校准对上估计它们的错误相关性,使用收缩估计。平均成对错误相关性为 0.206,这给出方差等效的集成规模为 3.51 个独立评审。因此,有用的量不是评审输出的头count,而是它们所代表的独立错误信息量。
依赖性改变结论,而不仅仅是增加不确定性。在多达 28% 的比较中,忽略共享错误会使一个系统看起来显著更好,而考虑共享错误的分析则不会。依赖结构也很重要:大多数评审共同的错误和集中在小脆弱子组的错误对共识的影响不同,并偏好不同的投票方法。单一的相关性摘要无法决定合适的聚合规则。
实用协议是:在一小批受信任条目上估计准确率和共享错误,然后在应用到新数据前选择投票方法。在跨八个外部事实性数据集进行的迁移实验中,针对每个部署约 100 个人工标注的校准样本,测试的选择器在所有情况下都选择了简单多数投票。那是该迁移设置的结果,而不是对多数投票默认化的一般理由。
边界是重要的。全域和子群失败制度是受控干预,因此并不能证明自然发生的普遍性;位置偏差是唯一被深入研究的共享脆弱性;自适应过滤器和选择器需要大约 100 个受信任标签;评审库有限意味着平均成对相关性和 n_eff 的估计不应被假定能迁移到显著不同的库或任务上。自动路由也不可靠:在 24 次混合制度比较中,有 22 次路由器未能优于制度预言器,在 19 次中路由器显著更差。
对于新的评审评估,具体操作是保留受信任条目,报告错误相关性和 n_eff 与共识一起,并在部署前在那些条目上比较聚合规则。研究问题是当评审库、任务或共享脆弱性变化时,相同的基于校准的规则是否保持稳定。
阅读此文以了解如何用一小批受信任的校准样本揭示当评审面板所含的独立证据远少于其人数时,并在部署前如何测试聚合选择。
abstract; S4.SS1.p1; S1.p7; S6.SS0.SSS0.Px3.p1.1; A10.SS0.SSS0.Px2.p1
