语义熵路由需要难度对照、上限空间检查和实际成本核算
Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself
评估升级路由时,应关注较大的模型是否修正了小模型的错误,而不能只看小模型是否显得不确定。本文检验了语义熵:在调用较大模型之前,测量小模型生成的多个采样答案在含义上的分歧。研究还加入了一种开销低、仅依据问题本身的难度估计,从而可以检验:除了问题看起来有多难,熵是否还能提供额外信息。
方法上的改变在于评估,而非提出新的熵估计器:将语义熵与仅基于问题的难度进行比较,明确界定升级目标,检查预言机上限空间,并计入生成该信号的成本。最强的正面结果是有条件的。在一次包含 250 个样本、使用 Gemma-3 1B/12B 且 k=10 个采样的 GSM8K 实验中,语义熵识别小模型错误的 AUROC 达到 0.871,但预测升级是否有帮助的 AUROC 仅为 0.734。因此,错误检测和升级价值是两个不同的评估目标。表面上的路由收益也不自动意味着服务成本更低:在 k=10、升级率为 0.56、假设成本比为 12 的配置下,估算的单次查询成本比始终使用大模型高 39%。这一结论取决于成本代理指标和运行点。
负向对照解释了原因。在合成算术任务上,由正则表达式得出的难度分数与熵的区分能力相当,因此这一看似强劲的结果并未证明熵能提供超出问题难度的信息。在同一基准上,相比始终使用大模型,预言机准确率上限空间仅为 0.021——分别为 0.677 和 0.656——限制了任何路由器可能取得的收益。PopQA 则揭示了另一项前提:修正评分后,两种模型在大多数样本上仍然答错,而且在预先评估阶段,没有任何样本呈现升级所需的“小模型答错、大模型答对”结果。
作为成本更低、可缓存的替代方案,检索过往结果的 AUROC 在合成算术任务上为 0.908,在 GSM8K 上则降至 0.518;在 GSM8K 测试之前运行的嵌入—难度诊断已预示了这一性能崩塌。这些检索估计没有 bootstrap 置信区间,知识库覆盖范围之外的表现也未经过测试。由此可得一项实用的研究操作:测量前先定义升级标签,报告仅依据问题的对照和预言机上限空间,并在路由 AUROC 之外计入信号生成成本。适用边界很重要:正面的实际运行结果仅基于一个数据集和一组模型组合;采样温度保持在 0.7,NLI 蕴涵阈值保持在 0.5。因此,本文提供的是一套可复用的评估方案,而非语义熵能够跨不同路由部署泛化的证据。
阅读本文可借鉴一套运行前评估方案,在路由成本和基准上限空间扭曲结果之前,区分不确定性信号与难度代理指标。
来源位置
自然范围检验可区分 LLM 特征操控与特征使用
Does the Model Use the Feature? Separating Steering from Mechanism in LLMs
局限
某个特征可以追踪一个概念,对它进行操控也可能改变相关行为,但这并不能证明模型在自身计算过程中使用了该特征。当任意强度的操控把特征推到其自然范围之外时,尤其难以解读结果,因为这种效应未必反映模型的计算过程。
评估框架
本文提出一套经验评估框架,在自然输入中观察到的取值范围内评估特征。对于匹配的输入,安装操作把一个表现出某种行为的输入中自然观察到的特征值复制到一个未表现该行为的输入中;移除操作则反向进行。第三项检验会编辑上游状态,随后在下游恢复该特征,同时保留上游编辑。安装测量该特征在多大程度上足以产生该行为,而移除和下游救援测量模型在多大程度上使用该特征。这些是不同的、以干预为条件的强度指标,而不是一个通用的机制评分。
审查发现
审查复现了两个已发表的 Gemma 实体潜变量的强关联和操控效果:它们能够区分已知实体与未知实体;在报告的测试中,对未知实体潜变量进行操控,使弃答率从 33.0% 升至 79.0%。但对于该潜变量,自然范围内的目标值只使弃答率改变 1.5 个百分点,区间为 -1.2 至 4.2;而超出自然范围的目标值使其改变了 12.0 个百分点。在匹配的已知—未知提示上,安装任一已发表潜变量仅转移了自然弃答率差异的一小部分,而且所有四个配对效应区间都包含零。
其他表征说明了为什么这些检验必须彼此区分。已知—未知稠密方向呈现相反的安装/移除模式:Llama 3.1 8B 的安装/移除/救援强度为 0.89/0.07/0.26,而 Gemma 2 2B-IT 为 0.27/0.61/0.09。相比之下,已发布的主语—动词一致性特征集在其解码器更新下,安装和移除强度均约为 0.95,救援强度为 0.88。结果还取决于如何将取值写入残差流:尽管特征值匹配得不那么精确,解码器更新仍产生了更高的安装和救援强度。
适用边界与研究用途
这些结果无法脱离所测试的表征、位置、编辑 token、更新规则和行为测量来识别某个特征。即使使用自然来源的值,也可能形成任何自然输入都无法实现的残差状态。单位置、单 token 的编辑也可能遗漏分布在多个 token 和层中的计算。按照本文的定义,由于没有对已发表的实体潜变量进行救援检验,其使用强度只是下界。
由此可得一项实用的研究操作:在得到操控结果后,构建匹配的自然值安装和移除检验;如果存在上游编辑,再加入下游救援检验;并在报告每项强度时同时说明干预细节。问题不只是特征能否改变行为,而是哪些经过测试的干预显示了充分性或依赖性,以及这一结论能延伸到什么范围。
阅读本文可了解一套具体审查方法,用来区分能够操控行为的特征与经测试的模型计算中可测量地使用的特征。
来源位置
pass@k 无法证明后训练后仍保留输出多样性
What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training
在总体层面,pass@k 取决于一个问题中每个样本答对的概率,因此无法区分答对概率相同、但正确答案、错误答案或推理路径的分布不同的模型。这是结构性局限,并非某个具体实验的失败。
方法。 本研究比较了在小学数学数据上训练的 Qwen2.5-1.5B-Instruct 所采用的 GRPO 与拒绝采样微调(RFT);RFT 使用模型自身最短的、通过验证器检验的生成轨迹进行训练。研究测量了 token 级熵、答案级熵和每个提示的唯一答案数,并进一步进行仅看正确答案、长度匹配和仅看错误答案的检验。
发现。 在所测试的设置中,GRPO 在每个随机种子下都降低了报告的三项多样性指标,而 RFT 的两个实验组在每个随机种子下都提高了这三项指标。在 GSM8K 上,pass@1 能区分两个实验组,而 pass@8 和 pass@32 未显示出一致的显著差异。在通过验证器的正确补全中,GRPO 的词汇多样性低于 RFT;在匹配补全长度后,报告的差异仍然存在。因此,pass@1 较高可能同时伴随着正确输出多样性较低。
与初始检查点的比较改变了对实验组排序的解读。在一个难度较高的 MATH-500 子集上,低 k 时,RFT 相对于初始检查点降低了测得的覆盖率,而 GRPO 与基线相比没有统计上可检测的差异。因此,GRPO 在该处优于 RFT,并不意味着其表现优于初始模型;这也可能只是损失较小。
适用边界与研究用途。 证据仅限于一个 1.5B 初始检查点;该效应是否适用于更大的模型尚未测试。仅正确答案的多样性、长度匹配后的多样性、仅错误答案的多样性,以及实验组间差异的配对分析都只使用了两个随机种子,而非三个。该比较也未能单独确定是哪项算法差异导致了多样性结果。
开展新的后训练研究时,应将 pass@k 与未经改变的初始检查点进行比较,并把多样性作为单独的测量目标。一个实用的最低要求是检查整体输出、正确输出和错误输出的多样性;使用词汇指标时,还应控制长度。这样,“哪个实验组胜出?”就能转化为两个明确的问题:正确概率是否发生变化?解答分布发生了什么变化?
阅读本文可借鉴其具体检验方法,重新设计后训练评估:区分 pass@1 优势、多样性保留,以及相对于初始检查点的改进。
来源位置
幻觉基准标签取决于评审者衡量的是参考忠实度还是事实正确性
The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation
简短参考答案的开放域问答基准可能混淆两个目标:参考忠实度——答案是否得到参考内容的充分支持;事实正确性——答案是否避免与事实矛盾,以及是否包含具体但错误的事实性主张。即使预期目标是后者,自动标注器也可能采用前一种标准。
为审查这种不匹配,作者使用了 900 组人工标注的问答对,涵盖三个常用问答数据集和三个生成模型。他们评估了词汇相似度指标、基于参考文本蕴涵关系的 NLI 基线,以及七个在受控提示变体下运行的 LLM 评审器。关键比较固定生成答案不变,让 GPT-5-mini 在忠实度导向提示和事实正确性导向提示之间切换,再将其标签与人工主要标签进行比较。
对 GPT-5-mini 而言,从忠实度导向提示改为事实正确性导向提示后,在三个生成模型组中的每一组上,与人工标签的配对一致性都有显著提升;Mistral-7B 输出上的提升最大。该比较仅适用于所测试的提示、评审器版本和答案集。因子消融结果支持这样一种解释:对 GPT-5-mini 而言,一致性提升的主要来源是评判标准的对齐,而非单纯扩充提示内容。这一效应已在该基准上得到展示,但并不能证明提示结构永远不重要。
另一项干预从 138 个经两位人工标注者均判定为非幻觉的答案中删去展开性内容:删除后,p1 假阳性率从 52.9% 降至 23.2%。这支持了展开性内容是忠实度提示导致错误的因素之一,但并非全部原因。另行而言,在严格设置下,所测试的 T5-11B 蕴涵基线相对于事实正确性标签产生了压倒性多数的假阳性错误;这只是关于该模型和阈值的证据,并不代表 NLI 系统的普遍表现。
值得借鉴的研究操作是一项配对标签审查:围绕矛盾与参考内容缺失来定义目标,固定答案和评审器版本,然后分别检验评判标准与提示结构。应追问标签变化反映的是构念不同,还是仅仅来自格式干预。
适用边界不容忽视。研究仅涉及英语开放域问答、简短参考文本和三个规模相对较小的开放权重生成模型;结果能否推广到其他语言、更长回答、其他领域、任务类型和生成模型,尚未测试。独立标注者之间的重合标注显示 κ=0.808、原始一致率为 90.3%,但所报告的一致性估计衡量的是标注者可靠性,并不意味着存在无误的真实标签。报告中的比较以这里评估的具体答案、评审器版本、提示和推理配置为条件。
阅读本文可借鉴一项具体的配对提示审查,在选择自动基准标注器之前区分参考内容覆盖度与事实正确性。
来源位置
探针分数必须明确下限与上限
How High Is 0.6? Floors, Ceilings, and Headroom in Interpretability Probing
为 0.6 并无固定含义:它可能反映输入中已经存在的可预测性,而且同一分数在不同数据上可能代表不同含义。因此,本文要解决的局限很具体:原始分数无法说明表征究竟增加了什么。
方法上的改变是,在解读探针之前,先声明目标 、受限信息集 和完整输入 。论文将下限定义为从 中可获得的最佳总体可预测性,将上限定义为从 中可获得的最佳可预测性,并将二者之差定义为可提升空间。当可提升空间为正时,归一化分数表示表征弥补了这一差距的多少:。实际操作中,参考值通过固定的线性与非线性解码器组估计;这些解码器以来自 和 的特征为输入,并使用相互独立的数据划分进行训练。
形式化分析区分了可提升空间较小的两个原因:目标可能对某个潜变量不敏感,或者可用输入可能无法识别该变量。因此,可提升空间较小,并不一定意味着表征未能恢复任务本可利用的信息。
关键的受控检验使用了为随机效应元分析训练的 Transformer。在 ID 到 OOD 的分布偏移下,xl 模型最终位置预测的 MSE 上升了 12×;与此同时,log 的已恢复可提升空间从 0.78 变为 0.82, 的则从 0.84 变为 0.85。较低的上限和相近的已恢复比例,支持作者的解释:偏移后的数据丢失了信息,而不是表征的相对效能下降了。这一解释来自受控任务中的证据,并不保证适用于每一种分布偏移。在两个完全指定的生成测试平台中,估计得到的下限、上限和可提升空间也都接近精确值。
该框架改变了对应用结果的解读方式。在四个真实的单细胞数据集中,scGPT 恢复了超出测序深度部分的 0.28–0.57 个数据集特定可提升空间,表明它对生物过度离散性的编码是部分的。在围绕用户属性展开的角色扮演对话中,汇总的 n-gram 下限为 0.92–0.98;每个已发表的阅读探针分数都落在下限的 95% 区间内,因此表面措辞解释了这些分数的大部分。
适用边界至关重要:改变 、 或 ,就会改变科学问题;归一化探针分数仍是可解码性的相关性证据,而非因果使用的证明。精确参考值的受控证据也来自刻意简化的任务和小型 Transformer。开展新的探针研究时,应报告原始分数,并同时说明预先声明的下限、上限、可提升空间、端点估计方法,以及所检验的具体对比问题。
借助本文,将常见的探针结果转化为更有针对性的实验:明确输入本身已经揭示了什么,估计完整输入最多能揭示什么,并报告表征恢复了剩余差距的多少。