Kalman Delta Networks 为 delta 规则关联记忆添加可与扫描兼容的不确定性
Kalman Delta Networks: Uncertainty-aware Associative Memory
线性注意力关联记忆存在一个特定的在线限制:delta-规则模型决定从当前 token 覆写的强度,但不表示其记忆估计中累积的置信度。KDN 不仅改变门控,而是改变状态。它将潜在的关联映射建模为带有噪声的键条件观测的线性-高斯状态空间模型。在该模型下,卡尔曼滤波器联合传播记忆的均值与协方差,其增益使用累积的证据和观测可靠性对残差写入加权。作为特例,可恢复出 delta 风格的更新:用逐 token 各向同性的预测协方差替代并放弃协方差跟踪。
工程约束是决定性的:精确的卡尔曼更新在每个 head 上需要一个稠密的 d_k×d_k 协方差和一个依赖状态的 Riccati 递归,因此对 GPU 并行的线性注意力扫描不适合。KDN 用两种兼容扫描的近似替代该精确递归。Diagonal KDN 假设动力学和过程噪声为对角矩阵,在每次更新后应用一次在线的反向-KL 均值场投影,并在每个 head 上保持 O(d_k) 的不确定性状态。Isotropic KDN 将不确定性压缩为每个 head 一个标量。在这两种变体中,不确定性递归都是一个莫比乌斯映射,因此增益可以通过具有对数并行深度的关联扫描发出。
Diagonal KDN 的保证更窄:在条件于对角预测先验的情形下,其反向-KL 投影保持了精确一步卡尔曼后验均值,同时用对角状态替换了稠密的后验协方差。
在模型规模实证中,论文报告称两种 KDN 变体在 WikiText 和 LAMBADA 的困惑度以及在所评估的线性时间循环混合器上的平均六任务零样本准确率方面均有提升。比较使用在 FineWeb-Edu 上从头训练的匹配容量模型:750M 参数对应 50B token,1.3B 对应 100B,序列长度为 4K,并且优化器与批次设置匹配。
运行时证据更加限定。在一个 one-H200 mixer-layer 基准中,Isotropic KDN 与 KDA 紧密跟踪;Diagonal KDN 成本更高,因为其通道级不确定性扫描,尽管论文报告它仍接近 GDN-2 并随序列长度线性扩展。
可迁移的研究操作是一次覆盖压力消融:保持论文的受控预训练配方不变,在重复且冲突的键上比较一个 delta 基线、Diagonal KDN 和 Isotropic KDN,并分别测量旧关联的保留、残差写入增益和语言模型损失。这将检验益处是否源自校准的不确定性、对角分解,或仅仅是一个额外的依 token 写入机制。
阅读此论文以学习如何在保留关联扫描的同时将不确定性转为显式的递归记忆状态,然后检验不确定性导出的写入增益是否确实减少了破坏性覆写。
来源位置
SVRL 训练多模态搜索代理以在强化学习轨迹内验证片段
Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
早期的 MMSearch-R1 使用图像和文本搜索,并以基于结果的奖励和搜索惩罚来引导按需工具使用。SVRL 针对其作者描述的相关限制:稀疏的结果层监督没有为应当信任哪些检索到的证据提供明确信号。该方法在 5,000 个视觉问答示例上微调 Qwen-2.5-VL-7B,并将证据评估移动到代理的轨迹中。
训练期间,代理提出多个候选文本查询并对检索项发出二元有用性向量。一个具有访问真实答案的更强 verifier(GPT-5)为查询和片段提供标签;仅当最终答案正确时才应用对齐奖励。SVRL 还添加了针对不必要工具调用的搜索感知惩罚和鼓励多样化、格式良好查询的查询多样性奖励。预期的推断过程在不调用该外部验证器的情况下使用学到的验证行为。
最清晰报告的结果是一个测试时的扩展实验:在一个包含 256 个样例的 FVQA-test 子集上、最多允许 15 个并行文本搜索时,SVRL 随着额外搜索预算继续获益,而 MMSearch-R1++ 在大约五次搜索后即趋于饱和。这是一个有用的可复现实验操作:改变并行搜索预算、以相同方式聚合答案,并记录准确率与搜索次数,而不是仅报告单一固定预算分数。同时记录片段级决策,因为它们会暴露被最终答案准确率掩盖的失败模式。
边界很重要。训练仍依赖于具有真实答案访问权限的 verifier 生成的标签,作者指出这造成对教师模型偏差的依赖。学到的过滤器在一个特定方向上表现保守:它接受了 1,495 个 GPT-5.0 标记为噪声的摘要,同时拒绝了 82 个 GPT-5.0 认为有用的摘要。实验覆盖的交互视野较短,动作空间受限于以图像搜索、文本搜索、验证和回答为中心。最后,主要准确率评估使用 GPT-5.0 作为裁判,作者注意到这不可完全复现且对提示措辞敏感。因此 SVRL 提供了一个具体的策略设计配方,但尚不构成一个独立于教师的可靠证据过滤说明。
阅读此论文以检查将片段验证作为 RL 动作是否改变紧凑多模态代理的搜索预算曲线,同时核查结果在多大程度上依赖于知晓真实答案的教师模型。
来源位置
盲文本评判再现争辩语气下的分歧模式
A Layered Analysis of Disagreement And Answer Quality in Multi-Agent LLM Debate
多代理争辩普遍被认为能通过呈现真实分歧来改进答案,但论文指出这一机制很少被检验。它将观察分为四类:代理的自报告一致性;回复中的文本反驳;在删除诱发指令后是否持续存在;以及对于开放权重模型来说,令态度的 token 对数概率响应。[来源:摘要]
作者在 750 次争辩中对三模型委员会在 GlobalOpinionQA 的开放式问题进行评估,分别在友好、中性和敌对语气下进行。表面上的干预很大:在友好与敌对两端之间的完全一致率相差 50.4 个百分点。为检验这是否仅仅是标签变化,他们使用了一个外部裁判只读取每个回复文本本身,而不查看自报告或立场指令。该盲裁判在试点与网格规模上重现了友好到敌对的一致性下降,因此证据支持回复文本和报告一致性标签都发生了改变。[来源:摘要;S1.I2.i2;S5.SS2]
后续分析缩小了可推断的范围。在删除敌对指令后,标签向一致方向回退的频率比保留指令并重新询问时高出 23.1 个百分点。第一轮的按问题加权的持续性分析结果不确定(p = 0.0625),而合并各轮后显著(p = 0.016);仅有 11/28 的第一轮回退在回复文本中也有体现。对于最终答案,经过偏差检验的陪审团产生了 299/299 的平局,而在可验证控制任务上的准确率没有变化。作者因此报告未检测到质量提升,同时明确指出陪审团只能排除大的差异。若不做偏差检验的陪审团则更倾向于支持争辩,比例为 66%,论文将此归因于阅读顺序。[来源:摘要]
一个可迁移的实验是将“代理改变了主意”视为一个多测量假设。收集自报告、进行条件盲的文本评估,并在声称持续性之前比较删除提示与保留提示的重新询问。单独验证裁判:在 107 个已完成案例上,论文的 Gemini 裁判在四级分歧严重性上接近人类一致性,但在二元方向判断上明显弱。对于开放权重探测,将 token 对数概率的移动作为额外诊断而非信念证据:作者警告饱和响应可能在极端处压平而非产生方向性迁移。[来源:S3.SS2.p1.2;S5.SS6.SSS0.Px3]
阅读此文以获取一个具体的审计设计,用来检验争辩引发的分歧是否同时出现在标签、文本、后提示持久性和 token 概率上,而不是假定这些信号等同。
来源位置
从漏洞状态预测到理由预测,性能持续下降
现有防御(如 GitHub Dependabot)常常产生大量误报,因为其粗粒度匹配无法判断一个被标注为有漏洞的依赖是否真正可被利用。VEX-Bench 将评估单位改为跨仓库案例,评估下游仓库中已知上游依赖漏洞是否影响该仓库。
该基准将评估单元从警报变为跨仓库案例。它包含从 GitHub 挖掘的 75 个真实案例,由安全专家标注,覆盖 Python、Java 和 Go。作者挖掘依赖更新的拉取请求,应用了包括依赖清单或锁文件变更在内的过滤,并随后进行手工注释。在校准阶段,五名注释者独立标注了跨三种语言的 15 个案例,初始 Fleiss’ Kappa 为 0.667;随后过程产生了共识标签。任务同时衡量二元的受影响/不受影响状态和细粒度的理由类别:一个“易受影响”类别加上四个“不受影响”的原因类别。
报告的实验在三个代理框架中评估了九个模型。在论文的隔离 Docker 设置和三次运行报告协议下,GPT-5.5 与 Claude Opus 4.6 在二元漏洞状态分类上达到约 80% 的 F1。对于更细的标签,只有 GPT-5.5 在细粒度理由分类上超过 70% 的 macro-F1;其报告的 macro-F1 为 73.5%。作者因此观察到,当任务需要理由类别而不仅仅是状态时,性能持续下降。这是一个经测量的基准模式,而非表明二元决策就足以用于部署决策的证据。
范围很重要。该基准有 75 个案例覆盖三种生态系统,一些理由类别样本很少。一个案例也可能存在多种有效解释,而基准只分配单一金标准解释。最后,VEX-Bench 评估的是从仓库中可获得的源代码和配置的快照,因此无法完全捕捉动态输入或特定部署环境。
一个可迁移的评估操作是分别对决策与其解释进行评分。对于正确标注项目为不受影响的代理,询问其是否选择了与参考相同的可操作理由类别——而不仅仅是其最终标签是否正确。回顾状态正确但理由不正确的案例可以揭示代理表面分拣成功在可审计理由方面仍存在的不足。
阅读 §3.2 和表 2,以获得一个将二元代理分拣与解释质量评估分离的具体模板,包括注释与静态快照的约束。
来源位置
ObGynLongBench 测量纵向 EHR 决策中的证据到电子病历差距
ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making
作者认为现有的医学基准大多呈现带有预先选择证据的静态问题;这就无法判断模型在定位并按时间锚定患者记录中的相关事实后能否做出决策。ObGynLongBench 改变输入而非临床问题:它包含来自 976 个真实孕产电子病历历史中抽取的 1,500 个基于规则的多项选择决策点。每个案例都有患者锚点、孕期时间线点和一个决策前信息边界,因此同一任务可以在提供支持证据、同日记录或决策前完整历史可用的三种情形下评估。([Abstract])
在 17 个 LLM 上,论文报告的核心结果是明显的证据到 EHR 的差距:模型在仅给出证据输入时表现良好,但当它们必须从就诊级或历史级 EHR 输入中提取证据时,准确率下降。因此论文将规则应用与证据访问明确区分。在 History 设置中,论文报告单一证据案例(L1)准确率最高,多源本地上下文案例(L2)较低,而需要跨越超过七天证据的长时域案例(L3)最低。作者还报告随着决策前 EHR 上下文长度增加表现降低。([Section 3.2; Sections 4.1–4.2])
失败模式不仅限于单题。在 240 名有连贯两次决策点的患者中,当模型错过第一次决策时,大多数模型在第二次的准确率较低;而在第一次回答正确时第二次准确率较高。这表明该基准中存在史内错误关联,但并不能证明一次模型错误引起下一次错误。([Section 4.3; Table 3])
最具体的系统性结果来自 EHR 访问比较。在三种 Qwen3.5 系列模型的平均上,一个主动搜索 Agent 达到 64.2% 的准确率,比直接访问高出 4.6 个百分点;其报告的最大增益是在 L3 案例上为 5.7 个百分点。该 Agent 在迭代语义检索中最多可使用 20 次交互回合,因此该结果适用于所测设置,不应被泛化为对所有 agent 的通用比较。([Section 5; Table 4])
一个可迁移的研究操作是保持决策规则和问题固定,同时逐步扩大可用记录范围——从金标准证据到本地就诊再到完整的决策前历史。这样就可以询问一个看似的推理失败是否实际上是检索或时间锚定失败,以及某个干预是否在长时域证据上最有帮助。
边界相当显著:队列来自一家三级医院,记录为中文,且多项选择题准确率并不评估开放式建议、不确定性表达或交互澄清。该基准能够诊断这些受控的 EHR 决策任务;它并不建立可靠的临床辅助能力。([Limitations])
阅读此文以采用一个受控评估设计,将临床规则应用与基于患者特定证据的检索和时间锚定区分开来,用于纵向病历。