在 Qwen3-1.7B 上,保留完整任务提示词并驱逐旧思维可保持报告质量,并加速长序列解码
Prefix Sliding for efficient test-time scaling
研究人员测试了一种做法:让推理模型保留完整任务提示词,但只在其键/值缓存中保留近期生成思维的一小段,而不是存储整条链。他们发现,这一 Prefix Sliding 规则在长输出时保持了报告的 Qwen3-1.7B 质量,同时显著加快了解码,因为在提示词和局部窗口填满后,保留状态不再增长。这改变了评估长测试时扩展的方式:在所测试的设置中,许多旧推理 token 可以被驱逐;不过,所测试的 LiveCodeBench 案例也显示了一个边界:早期写下的代码可能在经过长时间推理后丢失,且论文未报告延迟事实引用评估。
在全注意力中,每个新 token 都能访问所有更早的 token,因此缓存会保留完整生成轨迹。Prefix Sliding 永久保留系统和任务提示词,包括可用的工具定义,并且只加入最新生成的窗口;较早生成的 token 会离开缓存。因此,即使推理持续数十万 token,保留的解码缓存也由固定前缀长度加局部窗口所限制。这并不会降低提示词 pre-fill 成本:极长前缀仍可能消耗大量内存。一个自定义的、兼容 Hopper/FlashAttention 的内核会跳过该区域之外的注意力 tile。作者还使用“Continue PE”:保留的 token 在驱逐后维持原始位置编码,从而避免重建缓存。
这是对已有流式缓存模式的扩展。StreamingLLM 已通过保留一小组初始 token 加上滚动的近期缓存,实现了成本有界的解码。更直接的先例是 H2O:这是一种更早的免训练 KV 缓存策略,动态保留 attention heavy hitter 与近期 token,并报告端到端生成推理结果。Prefix Sliding 则预先固定保留的前缀,并将其与近期窗口结合;其增量在于这种前缀保留策略、自定义内核,以及将其应用于长推理和截断反向传播训练,而不是首个有界缓存解码器。该固定前缀旨在保留小规模 attention-sink token 或事后选出的 heavy hitter 可能无法保留的指令和工具。
训练方案将同一区分应用于长强化学习 rollout。训练器接收最近四个局部窗口:前面三个提供上下文,最后一个窗口接收学习损失。在采用这一近似前,作者比较了随着所提供上下文增长,生成器和训练器的对数概率。这是一项有用的研究操作,因为它衡量训练器是否复现了生成器的局部行为;它并不能证明对远早于最后窗口的动作进行了等效的信用分配。
最清晰的免训练证据见附录 C 的表 1。在使用 4,096-token 窗口的 Qwen3-1.7B 上,Prefix Sliding 报告的 AIME25 avg@64 为 33.9,而全注意力为 34.2,其中 avg@64 是 64 次随机运行结果的均值。在同一服务基准中,在一张 80GB H100 上使用 vLLM 自动批处理和 FlashAttention 时,32K 序列长度下的吞吐量为 5,479 对 1,477 tokens/s。该结果支持一个质量—吞吐量表现强劲的工作点,但该表并未确立相同 token 数下的质量:两种方法产生的平均输出长度不同,且未报告不确定性区间。
可迁移的操作是在驱逐上下文前对其分类:保留不可变的任务状态,限制近期工作状态,并用延迟引用任务测试驱逐规则。论文的 LiveCodeBench 局限给出了重要边界:当早期写下的代码在经历长时间推理后仍被需要时,短窗口可能丢失必要状态。因此,Prefix Sliding 是适用于合适长时程轨迹的实用缓存策略,而不是历史推理可被普遍丢弃的证据。
阅读附录 C 的表 1,以核实接近全注意力的质量点如何与长序列吞吐量及不相等的生成长度相配对。
来源位置
一项新批次测试催生 SAMuon:在 Muon 的尺度上保留最强更新方向,并为其余方向赋予更大步长
Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon
研究人员提出,每个矩阵更新方向是否都应使用相同的步长。他们将每次更新拆分为最强方向和其余方向,然后在一个新批次上而非产生该更新的批次上,比较每部分能承受多大的步长。最强方向能承受的步长大致为 Muon 当前的尺度,而其余主体能承受更大的步长,因此 SAMuon 将最强方向维持在接近 Muon 的尺度,并放大主体方向的步长。为进行下述比较,论文将其调优后的 Scion 实现称为“Muon”。这使得为每个方向分配相等更新幅度在主体部分显得保守,但对 Muon 相对于 Adam 和 SGD 的更广泛解释仍只是启发性的,并未得到完全确立。
Muon 为每个矩阵保留动量缓冲区并对其进行白化,因此其最强方向和其余奇异方向获得近似相等的更新幅度。论文新增的操作是一种样本外、按秩分辨的探针。在某个检查点,一个梯度批次更新缓冲区;作者将 72 个矩阵缓冲区分解为奇异方向,并从所有矩阵中的相同秩构成一个全模型探针。随后,一个不相交的留出批次决定沿该探针迈出一步有多大效用。局部二次估计在不构建 Hessian 的情况下给出偏好步长,附录还在相关范围内将该估计与直接的一维步长搜索进行了核对。这扩展了对 Muon 的并行曲率解释:它测量可迁移的逐秩分配,而不只是比较汇总的批内曲率量。
探针显示出一个不稳定的头部和一个宽容的主体。在 64M Muon 轨迹上,领先方向的偏好步长与 Muon 的统一尺度相一致,而主体方向偏好大数倍的步长。SAMuon 将多个领先方向维持在接近 Muon 的尺度,并提高主体尺度。完整版用随机低秩 SVD 估计多个领先方向,并施加渐进的基于秩的配置。SAMuon-lite 只用幂迭代估计领先奇异对,保持该方向锚定,并对其他所有方向统一提升。两者都保留了与 Scion/Muon 相同的持久动量缓冲状态,并在训练早期逐渐引入这种塑形。
主要比较使用了七个 FineWeb 预训练单元,涵盖 124M 至 1B 参数、12 层的 modded-nanogpt 模型。相对于论文调优后的 Scion 实现——即其称为 Muon 的实现——SAMuon 在每个评测单元中都达到更低的最终验证损失,并估计达到 Scion 最终损失所需 token 减少 13.3%–24.0%。这一比较并不对称:超参数在 124M 模型上按批次大小调优后迁移至不同规模;SAMuon 使用固定半径 50,并在更大规模上不重新调优地迁移 gamma,作者指出,为 Muon 优化的日程和更大规模设置使其相对调优不足。相对于 Scion 日程,SAMuon-lite 实现了 13.3%–22.1% 的 token 效率提升,保留了 SAMuon 的 13.3%–24.0% 增益中的大部分。这些估计来自分别训练的、缩短且完全退火的日程。每种配置只有一个随机种子,且比较对象是 Scion,而不是单独测试的原版 Muon 实现。在一次计时测试中,lite 每次迭代增加 0.5%,而完整版 SAMuon 的 SVD 增加 7.4%;这是在一套 RTX 6000 Ada 设置上测得的,并非端到端的达到目标时间测量。
可复用的研究操作是:从一个批次构成方向,在另一个批次上测量其有效步长,根据直接搜索验证廉价估计器,然后测试由该配置所建议的最简单分配规则。这种分离可揭示由拟合构造批次造成的表观尾部容量。证据仍局限于局部和一次一个方向:跨秩交互、模块特定行为、更大部署宽度和多随机种子变异性尚未解决;Adam 比较省略了非对角耦合,且主要网格中没有 SGD 运行。
阅读论文第 4.1–4.2 节和图 1,了解作者如何将矩阵更新拆分为最强方向和其余方向,并在不相交批次上测试其步长;随后查看第 6.2 节和表 1,核实 SAMuon 比较的是称为 Muon 的调优 Scion 实现,而不是单独测试的原版 Muon 运行。
来源位置
在选定的匹配缺陷修复任务上,加入预期行为提高了四个模型的解决率
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
RealSWE 将一项可执行的仓库任务变成多个请求变体,在保持代码、测试和金标准补丁不变的同时,改变请求中包含哪些部分或这些部分的措辞。它发现,在四个受测模型中,加入软件应具备何种行为的明确陈述,能一致地改善稀疏缺陷修复请求。这会影响我们对编程智能体基准的解读:分数差异可能反映了缺失的规格内容,而不只是模型能力。
对于一个缺陷报告,问题陈述描述看起来出了什么问题,而期望行为说明正确结果应是什么样。RealSWE 还区分复现步骤、环境信息和附加上下文。先前工作已表明,将经过润色的基准 issue 改写成更像用户提出或更缺乏规格的请求,可能降低智能体成功率,其中包括 Saving SWE-Bench。RealSWE 的方法学新增点是组合控制:它从同一任务创建多个变体,从而能够将字段内容与面向更口语化风格的整体改写分开测试。
作者从 SWE-bench Verified 和 Pro 中导出 381 个任务家族,其中包括 192 个缺陷修复,并以相同的 mini-SWE-agent 设置、源容器、步数上限和重复运行进行评估。其真实性目标来自经过筛选的 SWE-chat 首轮样本:大多数保留请求只包含问题陈述,或包含该陈述和有限的附加上下文。这些家族是所选源任务,其所需字段均存在;对于 101 个缺陷修复任务,环境信息还取自发布的执行容器。所报告的“Original”条件也源自原始资料:对于一些任务,它从容器补充环境信息,并合并 Pro 描述中的部分内容。
最清晰的匹配比较是在保持底层任务不变的条件下,将期望行为加入问题陈述。在四个模型中,三次运行多数决的解决率增益为 6.8 至 9.9 个百分点,且每个模型层面的比较都通过了论文的多重比较校正。沿所测试路径移除复现步骤、环境信息或附加上下文,并未产生一致的平均损失;这并不表明这些细节对个别事件没有用。在并行的全字段改写中,将表达改为目标随意风格没有产生稳定的解决率效应,这支持了如下解释:稳健结果更紧密地关联于缺失的预期,而非这种整体语言重述。
可迁移的研究操作是在将性能变化归因于真实性之前,先构建匹配的任务家族。保留可执行任务和验收目标,一次改变一个沟通因素,并结合语义保留审计使用按任务配对的结果。对于稀疏的单轮缺陷报告,匹配结果表明预期行为可能是高价值的澄清目标;但尚未测试智能体是否应首先询问它。该建议仍以这些选定源任务家族、四个模型和单轮脚手架为条件;RealSWE 未测试交互式澄清策略。
阅读附录 E 的表 9、面板 C,以核实匹配的问题陈述与期望行为比较及其在各模型上的不确定性。
来源位置
在强制闭卷答案正确的事件中,四个 7–9B 经指令微调模型在貌似合理、近似但错误的工具返回后,仅在 6.5–17.1% 的符合条件案例中保留该答案
MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models
MemToC 固定一个问题和可执行工具调用,记录模型在看到工具之前的回答,然后替换为已知正确性的一项工具返回。它发现,在模型强制闭卷回答正确且工具返回为貌似合理、近似但错误的情形中,四个经指令微调的 7–9B 模型仅在 6.5–17.1% 的符合条件事件中保留了该答案。这改变了研究人员评判工具使用的方式:只有在工具正确时遵从工具才有用,因此评估必须区分来源偏好与来源正确性。
先前工作已引出纯记忆回答和工具条件下的回答,并依据任务金标准标注它们的正确性,包括任一来源正确、两者均正确或两者均不正确的情况 TMC,第 3.5 节;第 4 节和表 1。MemToC 更狭窄的新增点是一项受控的调用后干预。它从 ToolHop 导出事实性问题;ToolHop 提供可执行工具底层设施和经验证的答案 ToolHop,第 2 节。该方法固定调用,并仅将观测到的返回替换为经验证正确的值或貌似合理、类型一致的错误值。对于每个模型,作者首先强制其给出闭卷最佳猜测。然后,他们通过将该回答和工具返回与经验证答案比较,对事件分类:只有模型回答正确、只有工具正确、两者均正确,或两者均不正确。最终响应分别按照保留正确答案、遵从正确工具和重复错误工具评分。
主要比较覆盖 542 个经筛选的事实性问题、三种指令表述和四个经指令微调的模型。在仅记忆正确的情形中,模型只在 6.5–17.1% 的符合条件事件中保留正确答案。当模型回答错误而工具正确时,它们在 86.0–93.1% 的情形中遵从工具。当两个来源都错误时,它们仍会在 78.4–86.0% 的情形中重复工具返回。这些汇总范围针对每个模型平均了三种指令表述;每个模型按表述区分的估计都使用其自身符合条件的来源正确性案例。因此,它们支持关于该受控设置中遵从行为的强结论,同时避免给出普遍性的模型排名。强制闭卷回答是最佳猜测,而非对信念的直接测量,因此保留应被理解为常规交互行为的、特定于该协议的上界。
可复用的研究操作是在测量裁决前,标注两个相互竞争的来源。对于检索或智能体基准,收集证据前回答,独立验证外部值,在相同问题和接口下注入正确及貌似合理的错误证据,并分别报告这三种行为。如果所得数据用于监督微调或偏好优化,MemToC 还说明,数据划分应遵循完整工具链和相关事实群组,而不应仅按问题 ID。证据仍受限于一个源自 ToolHop、以人物传记为主的基准,合成的短返回和开放权重模型,因此它确立的是一种测量模式和对工具遵从的明确诊断,而不是智能体行为的一般规律。
阅读表 1,以核实三种来源冲突条件下的保留、遵从正确工具和遵从错误工具,以及工具错误后的弃答如何在四个模型间呈现分歧。
来源位置
FaithSieve 检查生成的奥赛证明中的局部转换,并报告称其对首个错误步骤的定位比一次性判定器更准确
FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence
FaithSieve 通过将一个自然语言数学证明的每个编号步骤拆解为更小的转换,将选定转换翻译为形式化义务,并用定理证明器 Lean 进行检查,来评估该证明。它报告,在其奥赛基准上,其精确定位优于一次性语言模型判定器。这使评估问题从“某个形式化陈述是否可被证明”转向“该陈述是否仍表达了正在判定的局部推理步骤”。
首错定位和细粒度证明评估在 ProcessBench 和 Hard2Verify 中已有先例,而 Chain-of-States 工作已在形式化证明构建期间用 Lean 检查相邻的证明状态。FaithSieve 的具体增量是将这些思路结合起来,用于审计已有、可能不正确的非形式化证明。原始编号步骤仍是输出地址,而称为 EdgeUnit 的内部单元记录输入假设、当前目标、所得上下文和目标,以及所执行的转换类型。
这一更细的单元支持按类型的检查。一个导出的事实必须能从此前可用的上下文推出;目标归约必须确实足以满足前一目标;分类讨论必须覆盖相关情形;所选见证必须满足其目标。当一个步骤引入事实并用它归约目标时,FaithSieve 会先检查引入的事实。一个怀疑搜索阶段选择可能有问题的单元和一段较短的前序上下文窗口,在限制形式化量的同时保留回溯到原始步骤的路径。
生成的 Lean 陈述在其证明或反驳被用作证据前,要经过语义闸门。该闸门检查假设、对象、见证、方向、逻辑角色和结论是否仍与自然语言义务对齐。仅有编译或证明搜索并不足够;形式化失败、超时和闸门失败均被视为无定论。所得局部证据随后被映射回粗粒度的编号步骤。
主要比较在 ProofLoc-Olympiad 上进行:350 道代数和数论问题,每道题均使用一份由 GPT-4o 生成的编号证明和专家标注进行评估。相较于仅获得问题和编号证明的一次性 GPT-5.4 判定器,FaithSieve 的精确首错准确率为 81.43%,而前者为 72.29%。精确准确率要求正确给出“正确”标签,或准确给出最早出现错误的编号步骤。这是对完整流程——分解、调度、类型化义务、语义筛选、形式检查和综合——的证据,而不是仅对 Lean 检查的证据,因为所有这些组成部分以及大得多的 token 预算都同时发生了变化。
这一保障措施也有明确弱点。在对 135 个生成形式化陈述的审计中,语义闸门接受了 20 个被专家标为不忠实陈述中的 13 个。因此,FaithSieve 提供的是有条件地有用的形式化证据,而非成功的 Lean 证明代表源推理的保证。所报告的 50 道问题成本测量中,GPT-5.4 使用的记录 token 数也是直接判定的 137.22 倍。
可迁移的研究操作是将用于报告的单元与用于验证的单元分开。在两者之间保留确定性映射,在后续义务中使用新引入的事实前先检查它,并将形式化或证明搜索失败记录为不确定性,而非错误标签。
阅读附录 F.4 的表 10,以核实核心的首错比较,并了解所报告的精确准确率增益究竟衡量什么。