目录
  1. 测得的有效学习率调度与预训练损失轨迹一致
  2. ZID 将排序、等同性检验与离散度诊断从 FID 与 KID 中分离出来
  3. 在决策旁放置有针对性的结构化重述可恢复披露的影响力
  4. Recuris 使用经验证的工作状态与门控记忆补丁来支持长程代理
  5. 经验证的任务覆盖通过不同有用结果评估有限 LLM 候选集合

测得的有效学习率调度与预训练损失轨迹一致

Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

早期关于有效学习率匹配的证据范围更窄:在 GPT-2-124M/OpenWebText 的 AdamW 实验中,匹配由权重衰减产生的有效学习率能够在 float32 中复现完整的训练动力学。该工作也报告说,仅匹配 ELR 并不能阻止部分 bfloat16 的发散,因此该效应是否超出该优化器和该设置尚未解决。 [arxiv:2310.04415v2; S3.p6; S3.p9; S3.F8]

当前论文将该想法转为一种配对的调度匹配检验。实验运行使用相同的初始化和数据顺序种子,同时构造不同的学习率和参数范数调度以匹配 ELR,这里将 ELR 定义为学习率除以参数范数。该研究报道了跨多种优化器、架构、数据集和模型规模的比较,而不仅仅局限于单一的 AdamW 语言模型配置。 [arxiv:2608.24814v1; S1.SS0.SSS0.Px1.p1.2]

核心结果被报告为 ELR 崩塌:当 ELR 调度被匹配时,完整损失轨迹的平均绝对差异仅为几个 10^-3 的量级。该条件很重要:比较是配对的并在预热后评估,因此该结果是受控调度匹配下的轨迹对齐,而不是断言任意运行会变得等同。 [arxiv:2608.24814v1; S1.SS0.SSS0.Px1.p1.2]

消融试验指出了该对齐何时减弱。在报道的 Llama-124M AdamW/FineWeb 环境中,移除 QK-Norm 导致平均崩塌误差从 2.3 times 10^-3 增加到 5.2 times 10^-3。在保持 ELR 的正弦调制下,将周期数从 2 增加到 32 把报告的误差从 2.8 times 10^-3 提高到 7.5 times 10^-3。因此,归一化设计和学习率–范数变化的时间尺度是实验变量,而不是应当隐藏的实现细节。 [arxiv:2608.24814v1; S4.SS2.SSS0.Px1.p2.1]

一个可操作的扩展是基于 ELR 的函数尺度定律。在四条非 Hyperball 轨迹上拟合后,它在不重新拟合的情况下预测了两条留出的 Hyperball 运行,均方根误差平均为 0.0212,而参数化为 LR 的版本为 0.2508。 [arxiv:2608.24814v1; S6.SS0.SSS0.Px2.p2.1]

边界是宏观的:所给的限制记录指出,transformer 并非严格尺度不变,因为它们包含可训练的向量值参数,且论文未提供微观的动力学解释。 [arxiv:2608.24814v1; A1.SS1.p1.2] 因此,一个有用的后续是按步记录 η、参数范数和损失,重现配对的 ELR 干预,然后在刻意变化归一化组件和调制速度时加入表征及下游探针。这样可以把损失轨迹控制与关于模型学到什么的更广泛主张区分开来。

阅读此文以获得一个低计算量的配对运行协议,用来测试某种范数控制方法在其诱导的 ELR 调度之外是否改变损失动力学。

来源位置

ZID 将排序、等同性检验与离散度诊断从 FID 与 KID 中分离出来

What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation

FID 的具体弱点是其基于矩的限制:对于任意具有有限二阶矩且协方差非零的分布,论文证明存在另一分布能共享其均值和协方差,从而使任何仅基于矩的差异——尤其是人口级 FID——为零。FID 和 KID 还生成对换样本不变的标量差异值,因此它们不能编码生成集合是欠离散还是过离散。

论文通过一个参考自适应的 ImageNet 构造演示了第一个限制。将噪声优化为匹配参考 Inception 的均值和协方差的图像在与参考比较时获得 FID 24.7,而对照的留出真实图像为 58.6(较低为更好)。对同一比较,ZID 报告的偏离分数为 17.2 与 0.86,且在 499 个随机标签置换中没有产生同样大的分数;留出比较的置换 p = .328。

ZID 将评估对象从单一标量改为三个关联输出。它结合了六个标准化的位置和离散度敏感分支:RISE、一个秩图表示,以及两个带宽的高斯核表示。然后它报告一个用于排序偏离幅度的索引、一个用于分布等同性的置换校准 p 值,以及一个有符号的离散度读数。当成员符号冲突时,方向性读数是有条件的:ZID 报告“member-sign conflict”而不是强行给出单一的欠或过离散标签。

在对 CIFAR-Inception PCA-128 特征、m = n = 200、300 次重复和 499 次外置换的受控实验中,ZID 是所有测试行中唯一在每个偏离列上功效至少为 .70 的方法。在六档严重性扫掠中,其分数在每个扫掠上均具有正向秩相关,范围从匹配矩的多模态时的 .56 到偏离流形支持时的 .95。消融研究将这种覆盖性归因于互补组件:移除 RISE 在八类偏离中有六类导致最大的功效损失,而移除中值带宽的 GPK 将位置检出功效从 .830 降到 .237,移除小带宽 GPK 则将非线性依赖功效从 .980 降到 .860。

可复用的研究操作是将三个独立问题分开提问——是否检测到偏离、在固定协议下偏离有多大、以及离散方向是否可辩护——而不是把一个指标当作三者兼顾。在比较分数时保持样本量、嵌入、参考集合和预处理固定。对于诸如优化得到的 ImageNet 图像之类的参考自适应集合,置换尾部是描述性的,而不是一个经过总体校准的两样本 p 值。

阅读此论文以了解生成评估度量如何揭示匹配矩分布的失败、对偏离严重性进行排序,并在不将参考自适应置换尾部视为经校准证据的情况下附带条件性离散度诊断。

来源位置

在决策旁放置有针对性的结构化重述可恢复披露的影响力

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

实验检验的内容

论文针对一个具体的评估局限:“基于检索的评估可以证明那些在投资判断中忽视其明确检索信息的系统是可信的。”作者在保持焦点公司信息不变的同时,将无关上下文长度从 2,000 变为 128,000 个标记,然后把定向检索与披露对投资判断的影响分开。这个实验拆分很有用:可以同时询问系统它是否能陈述一条披露,以及改变该披露是否会改变其决策。

报告的差距

在定向提问下,“相比之下,直接检索保持稳定。”对于主要的 Qwen3.5-9B-Base 系列,提供的证据报告在每个测试的上下文长度上对 12/12 家公司的检索均为阳性,包括 128k 标记,并且在中性控制申报上无误报。然而,风险披露对决策的影响在长上下文中降至实验噪声下限。在更有能力的模型中,这种模式被延后但并未消除:“更有能力的模型推迟但不消除该差距。”

工作流结果是具体的。在 Qwen3.5-9B-Base 的 128k 标记设置下,论文报告的基线保留率为 12%,而“提取然后决策”——在决策旁放置有针对性的结构化重述——达到 67% 的保留率,对 12/12 家公司均有正向效果。相比之下,“分块然后聚合”在所有测试长度上都消除了该效果。作者的注释审核将该失败定位在决策阶段之前:在 2k 时“在二十四个公司-安排单元中合并笔记均缺乏目标披露”。

可复用之处

作者还使用干预来区分两条拟议的传递途径:压缩的运行摘要和基于注意力的查找。他们报告这两者各自承载了披露影响的相当一部分,并且所估计的效应在公司间统计上不可区分。可迁移的研究操作是评估一个工作流的配对反事实:保持文档和决策任务不变,改变一个与决策相关的披露,测量检索和由此产生的决策差异,并审计中间表示是否保留了该披露。

这尚非面向所有架构的因果解释。通道识别来自一个混合模型家族;作者指出在没有循环通道的架构中披露如何传播仍待绘制。他们对真实文件的复现也被描述为探索性且具能力条件性,而非普适。

阅读此文以获得一个衡量模板,用于测试检索到的证据是否改变 LLM 的下游决策,以及一个其长上下文效果以数值形式报告的工作流干预。

来源位置

Recuris 使用经验证的工作状态与门控记忆补丁来支持长程代理

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

长程代理面临一个具体的控制失效:随着历史增长,任务状态可能被遮蔽且技能调用可能错位。Recuris 通过将当前任务控制与累积经验分离来应对这一点。其工作记忆跟踪进度并根据当前需要而非完整历史指导从经验记忆中选择技能。

Recuris 维护一个经验证的工作记忆以记录任务进展,使用它从经验记忆中选择技能,输出结构化执行轨迹,并仅在对留出或开发任务进行验证门通过后对组件范围内的补丁进行应用。这些轨迹连接了工作状态、检索到的经验、动作、观察、拟议的状态更新、检查器结果以及已提交的状态。一个固定的元代理使用这些证据将故障定位到四个记忆控制组件之一,然后提出补丁。外层过程是固定的:基础 LLM、工具、元代理、定位与打补丁流程、验证门以及记忆控制层外的测试装置在多个轮次中不变。

对研究者而言,可迁移的操作是——在增加递归之前缩小可编辑表面:定义带显式不变量的状态模式,使变更产出机器可检查的证据,将故障与特定组件关联,并仅在留出任务上验证该有界变更。这是一个设计经验教训,而不是结构化轨迹优于其他诊断方法的证据;所给记录中不含定位准确度的正面对比。

在四个长程基准和十个模型上,摘要报告在 37 对已完成的模型-基准对中有 35 个得益,包括在 tau-bench 上 GPT-5.6 Sol 提升 +17.8 点和 Claude Opus 5 提升 +15.6 点,在 SkillFlow 上 Qwen3.6-27B 与 Qwen3.6-35B 分别为 +16.6 和 +13.5,最长期任务上最高达 +32.2 点,常见长程失败减少最多达 80%。

重要边界是测试时适应。在 Terminal-Bench 2.1 的测试时适应研究中,对 87 个任务和四次尝试的匹配预算,适应比重试初始记忆额外增加了 2.3 点,赢得 7 个任务、失去 5 个(p=0.774),该差异不具统计显著性;而重试本身解释了相对于单次尝试基线的 +26.4 点改善的大部分。迁移是有条件的:如果留出任务不再包含记忆修复所对应的故障类型,则没有可迁移的内容。

阅读它以学习如何通过将显式状态检查、局部化失败轨迹、有界补丁与留出验证耦合,使递归外部记忆更新可审计化。

来源位置

经验证的任务覆盖通过不同有用结果评估有限 LLM 候选集合

Evaluating Multiple LLM Generations with Validated Task Coverage

大多数 LLM 评估逐条给生成结果评分。本文改为将有限的生成集合作为评估对象:问题是,在固定尝试次数下出现了多少不同的、与任务相关的结果。

经验证的任务覆盖(Validated Task Coverage, VTC)将该问题显式化。对于任务 x,它验证并将每个生成 yi 映射到有用结果,对尝试取并集,并应用覆盖效用:

VTCx(y1:k)=ux(i=1kτx(yi)).

该构造要求一个任务特定的确定性函数 τx:它必须识别满足任务约束的输出,并将有效输出映射到其区分性重要的离散结果。VTC-Bench 在五个真实数据任务上实例化了该设计——分子设计、代码库修复、漏洞发现、鉴别诊断和证据检索——使用自动、可复现的评分而非基于模型的裁判。其结果表示包括分子骨架、被修改的函数集合、行为性错误类别、UMLS 概念和推理方面。

选择结果具有重要意义。在 24 个模型–推理配置和基准的标称预算下,由一次抽样质量排名最高的五种配置在五项任务上造成的平均 VTC 遗憾从证据检索的 2.2% 到代码库修复的 25.0% 不等,任务宏平均为 12.1%;一次抽样和 VTC 前五集合仅共享 25 个位置中的 10 个。优选配置也依赖于尝试次数:在五个任务中有四个任务,k=1 的领先配置不同于标称预算 H 下的领先者。因此简单的输出变化度量不应被视为任务性覆盖的替代。

干预结果提供了具体的实验教训。将温度从 0.6 提高到 1.2 在 40 对匹配比较中有 38 对在 H 下提高了 VTC,尽管一次抽样质量在其中 25 对下降。把后续尝试以先前输出为链式输入并附加显式不重复提示并非普遍有益:它持续改进了证据检索,持续降低了代码库修复覆盖,在大多数鉴别诊断配置中降低覆盖,对漏洞发现影响不大,并且在分子设计上呈现更大的配置依赖性。因此,应将温度和链式尝试作为任务特定的覆盖干预来测试,而不是假定它们普遍改进候选集合。

一个可迁移的后续操作是:在比较推理设置之前指定验证器和结果映射,然后同时报告 k 下的覆盖与一次抽样质量。主要边界是冻结目标使绝对覆盖具有参考相对性:在注释目标之外的有效结果不计入得分。尝试次数在代币使用、计算或人工审查工作量上也不可跨任务比较,因此更高的 VTC 曲线本身并非资源等价的胜利。

阅读此文以学习如何用确定性、以任务为基准的覆盖测量替代单一输出或表面多样性比较——以及温度、链式尝试和尝试预算如何改变被选配置。

来源位置
本期按 2026-09-01 的候选论文事后编制,核验日期为 2026-09-12。