2026-09-04

2026-09-04

解释性漂移在长文档 LLM 财务分析中主导 persona 效应

The Analyst in the Prompt: Role, Retrieval, and Memory Biases in LLM Financial Analysis

早期关于提示敏感性的工作发现,在少样本分类任务中使用语义等价的格式会导致最多 76 个准确率点的性能差异。对长文档 RAG 评估的限制在于归因:答案的变化可能反映检索变化、解释变化,或两者兼有。本文通过分别测试这些通道而不是将 persona 偏差视为单一提示层面效应,改变了对照方式。

审计涵盖 3,575 份 SEC 10-K/10-Q 报告和十二个 LLM。PR 将 persona 条件化的检索与 persona 角色提示结合。NR 使用中性检索并采用相同的角色提示,同时检索到的片段在各 persona 之间为字节逐位相同。MEM 保持检索和助理角色中性,将投资者心态放入用户资料或记忆简介中,并将响应路由到基于证据和个性化的字段。

在四个匹配对中,NR 平均保留了 PR 效应的 69%,中位数为 68%,模型级别的保留率在 44–89% 之间。因此,在此设置下,大多数 persona 变动在证据固定时仍然存在:论文将解释性漂移识别为主导通道。检索仍会改变选择:ShortSeller 在 20.9% 的情况下检索到 Risk Factors,而中性基线为 13.9%。这些是不同的通道,选择差异并不能解释大部分测得的效应。

缓解措施有用但不完整。对于最强的 ShortSeller/DownsideProtection 配对,从 NR 转到 MEM 会使证据-分数系数缩小 51–87%,面板中位数为 73%。在 MEM 中,所有十二个模型的平均泄漏均低于 0.5,但作者将双输出路由描述为风险降低而非保证。

为了可复用的评估,请复制该序列:允许个性化改变检索,逐字节固定检索到的文本,然后将相同的心态从助理角色移动到用户配置文件。报告 PR 到 NR 的保留率和 NR 到 MEM 的收缩,并检查证据字段中的泄漏,而不要假定 JSON 模式能强制实现分离。

保持结论的范围限定。主要分析使用的是 SEC 报告、一个检索编码器和一类提示模板,因此效应幅度在其他场景中可能不同。三通道分解是一种账目式分解,而非形式的因果中介。公开文件可能已出现在预训练中,且在文件内的比较无法消除记忆化或预见性问题。最后,spillover 衡量的是相对于中性条件不变量参考的移动,而不是相对于外部验证的真实值的偏离。

阅读本文以复制一个区分检索变化与解释漂移的三臂 RAG 审计,并测试基于用户资料的表述是否减少泄漏。

S4.SS1.p1.1; S4.SS2.p2.1; S4.SS3.p1.1; A4.SS7.SSS0.Px1.p1.1; Sx1.p1.1; Sx1.p2.1; Sx1.p3.1; Sx1.p4.1 · Abstract and S1.p1

反事实审计的翻转率需要逐动作测得的不稳定性下限

Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor

在反事实审计中,一个动作的翻转并不能被解释为人口统计学差异,除非将其与代理在相同条件下针对该动作自身的不稳定性进行比较。FairMedAgent 通过在一个包含五个模型面向决策和一个确定性环境步骤的六阶段临床代理轨迹内,重新运行参考条件并使用相同的病历与描述符来测试该基线。

报告的参考协议使用了 10 次独立重复,在 16 个病历上,采用提供者默认、非零温度采样。跨重复的成对比较产生了 4,320 个结果–病历比较。合并的解码不稳定性下限为 0.087,即 4,320 次比较中有 374 次翻转,簇自助区间为 [0.056, 0.116]。该下限强烈依赖于动作:报告的速率在 0.022(ICU 升级)到 0.179(受控物质警示)之间。

这种差异表明,相关比较单位是动作,而不仅仅是整体代理。因此,论文建议在每个群体对比旁边报告逐动作的下限并声明解码配置。该基线并不限于单一系统:第二个模型报告的合并下限为 0.067,而第一个模型为 0.087,且六个动作的不稳定率在模型间的 Spearman ρ=0.94。

重复有帮助,但并不能使问题消失。多数投票聚合将单次抽样的合并下限从 0.087 降低到三次抽样时的 0.063、五次抽样时的 0.053,在趋平之前大约去除了 39%。一个零假设模拟将剩余曲线置于异质逐单元采样概率预期范围内。

现有的人口统计学试点并非不平等结果:没有人口统计学对比可与测得下限区分开来,作者也未提出差异主张。它使用了四个病历并在单次抽样的人口统计学单元上操作;一些处方比较受提示重新发布的影响,且临床医生分组裁定不完整。所提的 within-range counterfactual flip rate (WCFR) 仅在两种动作都落入临床裁定的可接受动作集合时计数翻转,因此在这些草案病历在裁定完成前仍未定义。

主要测量边界在于,一次翻转可能反映对描述符措辞或标记差异的敏感性,而非人口统计学推理。基准也使用了合成病历和粗糙的人口统计学描述符且簇数有限,使某些域级区间较宽。其中一个动作“受控物质警示”缺乏可操作的临床标准,可能反映构念未充分定义。

对于新的审计,可转移的操作是具体的:重新运行参考条件,为每个动作单独估计下限,将人口统计学对比与相应下限比较,并报告解码设置。低于或接近该基线的对比应仍被视为随机性发现——在更高统计功效且经裁定的测量能区分机制之前,不应被视为人口统计学差异的证据。

阅读此文以学习如何将原始的反事实翻转率转化为可解释的、针对每个动作的与测得随机性基线的比较。

Abstract; §V-A; §V-B; §V-C; §IV-A; §VI-A

教师探针通过按提示分门别类决定密集在策略蒸馏的通行率

Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation

Vanilla OPD 对所有提示一视同仁地应用教师监督,尽管反向 KL(reverse KL)趋向于寻模(mode-seeking),而自信但错误的教师可能引入强而误导的更新。熵(entropy)和师生似然一致性(teacher–student likelihood agreement)可以提供不确定性或一致性信号,但它们并不直接验证结果正确性。

TGOPD 将信任单元从未经检验的提示换成经经验检验的提示。对于每个提示,冻结的教师生成 K_T 个 probes;一个二元验证器对其评分,经验通过率 q_T(x) 成为硬门控。在主要实验中,K_T=3 且 τ=2/3:至少两个通过的探针将该提示路由到密集的逐标记 OPD;否则教师监督被阻止,采用以验证器为依据的 GRPO。该门控是排他性的,而非对教师 logits 的连续弱化。探针被安排到异步设置中原本空闲的教师时窗,因此可靠性估计也利用了本来会空闲的容量。

最强的证据并不是单一的汇总数值。TGOPD 在数学、代码和指令跟随的六个单域设置中对 4B 和 35B students 均优于 Vanilla OPD,并在多域训练的七个基准平均上在两个尺度都更高。在报告的 35B 代码设置中,作者指出其他蒸馏变体产生了负迁移,而 TGOPD 是唯一带来正迁移(+3.0 over base)且在 LiveCodeBench (+1.3) 和 OJBench (+1.1) 上超过教师的方法。在一项测量的 4B 单域运行中,当探针工作重用空闲容量时,teacher-node GPU 利用率从 9.8% 提升到 78.9%。这些是报告的条件,并非证明该配方能迁移到每个验证器或部署环境。

因此一个实际试点应记录的不止最终基准分数:应变动 K_T 和 τ,记录发送到 OPD 与 GRPO 的提示比例,并测量探针的墙钟成本与利用率。包含掩码/不更新的回退机制很重要,因为当被门控的一组中所有 rollout 都收到相同奖励时,中心化 GRPO 恰好没有任何优势且不会产生更新。该方法当前需要一个自动二元验证器和二元路由,因此其证据并不直接覆盖开放式任务。可迁移的问题是:在相同的 student、teacher、verifier 和 rollout 预算下,提示级的通过率是否能预测密集教师标记何时比全局 OPD 权重更有帮助。

如果你在决定是否在异步 OPD 流水线中添加一个由验证器支持的提示级信任门,并且在运行试点前需要关键的回退失败情形,请阅读此文。

Abstract; §3; §4; §6

EarlyEval 通过从部分轨迹预测结果在任务内部降低代理评估成本

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction

代理评估存在一个具体的低效:此前侧重于基准蒸馏的工作减少了评估任务的数量,但保留任务的执行成本不变。EarlyEval 将其视为互补的效率轴:预测一次运行最终会成功还是失败,然后在预测足够自信时在完成之前停止运行。[arxiv:2609.02783v1, Abstract]

EarlyEval 使用行为、文本和参考解特征训练一对 LightGBM 的成功与失败分类器。在运行时,它在运行期间提取前缀特征,并在任一经过校准的分类器越过设定置信阈值时中止代理。报告的实现增加了可忽略的每步开销。[arxiv:2609.02783v1, Abstract; III-D, III-E, IV-D] 评估协议采用任务分区的逐代理留一测试;对于 TerminalBench,作者还测试了从训练中排除相同模型或相同脚手架的设置。[arxiv:2609.02783v1, IV-B]

论文在 SWE-bench Verified、TerminalBench 和 Toolathlon 上报告了结果。在这些基准上,EarlyEval 消除了 13%–26% 的代理步骤,最多节省 44.1% 的输入令牌和 29.4% 的输出令牌,预测准确率为 89%–97%。每个代理的解析率平均仅改变约一到两个百分点。[arxiv:2609.02783v1, Abstract] 这些数字描述的是一种近似评估模式,而非对完整执行的精确替代。

该边界在操作上很重要。EarlyEval 需要目标基准上一池已完成且带有结果标签的轨迹,因此它不适用于没有历史运行的新基准。[arxiv:2609.02783v1, S8.p1] 作者还指出,提前停止会引入约 1–2 个百分点的系统性解析率偏差;因此规范的、可引用的得分和排行榜的标题性声明仍应来自完整运行。[arxiv:2609.02783v1, S8.p2]

可转移的研究操作是将探索性评估与成绩发布分开:在已完成的运行上训练预测器,根据明确选择的计算–保真度权衡设定置信阈值,并在重复的开发检查中使用提前停止,同时将完整运行保留用于最终报告。该方法的有用问题不是简单地代理是否可以被提前停止,而是哪些轨迹信号能在被保留的代理上保持可靠,以及在节省值得该近似之前需要多少历史数据。

阅读此文以了解如何从已完成的基准运行构建一个阈值化的早停评估器,以及何处必须以完整执行让位于其近似得分。

Abstract; IV-B; S8.p1; S8.p2

声明式注意通过减少被访问的 KV 位置在 15 个长上下文任务中以适度精度损失降低代价

Language Models Can Control Their Own Attention

声明式注意(Declarative Attention,DA)将注意力选择变成一种文本协议。DA 将长输入划分为编号的“魔术块”,并要求一个现成模型(无需参数更新)发出 <global><focus magic_chunks="K"><local> 的声明。在运行时,vLLM 集成的状态机读取输出流,将这些转换翻译为块对齐的 KV 缓存掩码,并让现有的注意力内核不变地运行;掩码应用于全局注意力层,而 focus 和 local 模式仅保留指定的块或最近的输出。

这一系统思路不同于仅仅增加另一个跨度预测器。早期自选跨度工作的自定义内核仅在被忽略的上下文以 64 或更多令牌为块时才有效。DA 将选择信号移入可解析的文本,并将执行委托给推理引擎的掩码重写,而非要求模型微调或新的注意力内核。这使得关键研究问题具有可操作性:模型声明的范围是否足够可靠以驱动稀疏读取?

头条结果以被访问的 KV 位置衡量:在 15 个长上下文任务上,DA 将 Gemma-4-31B 的平均解码注意力成本降低了 52.0%,将 Qwen-3.6-27B 降低了 31.1%,精度下降分别为 1.27 和 2.75 个百分点。消融实验孤立出机制:相对于 DA-nm(不使用自定义掩码的相同协议),掩码在 Gemma 上将被访问令牌减少了 71.1%,在 Qwen 上减少了 46.5%。相对精度在两个评估家族中均随模型规模增加而提高,分别达到 Gemma-4-31B 的 99% 和 Qwen-3.6-27B 的 97%。

运行时结论需更窄的措辞。报告的 0.71× 和 0.77× 的解码时间系数是基于 B200 bf16 假设的 roofline 估计,而非测量的实测时钟结果。DA 还有两个协议边界:分块可能破坏全局计数或跨块拆分的表格所需的信息,且作者禁用了 thinking 模式,因为模型在思考轨迹内部未能遵循标签。

一个有用的复现操作是记录每个声明、生成的掩码、被访问令牌计数和答案正确性,然后在相同迹线上比较 vanilla、DA-nm 和 DA。具体问题是,在包括解析、分块失败和模型特定标签遵从性后,块对齐掩码是否产生测得的端到端加速。

阅读此文以跟踪模型生成的注意力计划是否能在从文本标签到 KV 缓存掩码的路径上存活,并识别在将模型声称的节省视为部署速度之前仍需的时序与鲁棒性实验。

[S1.SS0.SSS0.Px1.p1.1]; [S2.SS3.SSS0.Px1.p1.1]; [S1.I1.i2.p1.1]; [S5.SS1.SSS0.Px3.p1.1]; [S5.SS2.SSS0.Px1.p1.1]; [S5.SS4.SSS0.Px1.p2.1]; [S5.SS4.SSS0.Px1.p1]; [A4.SS4.p1]; [S4.SS0.SSS0.Px6.p1.1] · [S5.SS2.p5.1; S5.F9 caption (text)]

本期按 2026-09-04 的候选论文事后编制,核验日期为 2026-09-14。