成对示例的幻觉信号以隐藏态均值位移为主
The Hallucination Signal Is a Mean Shift: Why Simple Probes Suffice
论文诊断的要点
隐藏态探针可以检测幻觉,但仅凭高探针得分无法判断检测器是利用了非线性结构,还是仅仅在线性高维信号上做了良好估计。Lee、Seo 和 Lim 使用成对的事实与幻觉示例来检验这一点。他们的核心九种条件分析使用了 Llama-3.1-8B、Mistral-7B 和 Qwen2.5-7B,数据集为 TruthfulQA、HaluEval-Dialogue 和 FaithDial;论文另行报告了在 0.5B 到 70B 之间 25 个模型的规模评估。
论文在最后一个 token 处提取隐藏态,并对所有方法使用在训练数据上拟合的 StandardScaler。在实验设置中未给出详尽的成对构造或单独的投影归一化程序。事实对比幻觉的均值位移向量是在每个交叉验证训练折内估计的,因此用于报告方向时不使用测试折的标签。
将均值方向与残余判别分离
在一个 oracle 单层——用持出集的 oracle 知识选定的一层——沿类别均值位移方向的单维投影在九个核心条件上的平均达到 0.834 AUROC。移除该方向后 AUROC 降至 0.499,在本评估中实际上为随机水平。这支持一个范围明确的结论:在成对的事实与幻觉示例中,主要判别信号来自类别均值位移,但该一维特征并未涵盖所有可用判别信息。
使用 C = 0.001 的全维 L2 正则化逻辑回归探针达到 0.952 平均 AUROC。为诊断该 1D 结果与全维结果间的剩余差距,作者将 Fisher LDA 与 shrinkage LDA(对大约 4,000 维的隐藏态协方差估计进行正则化)进行比较。shrinkage LDA 达到 0.920 平均 AUROC,按作者计算至少弥补了 Fisher-LDA 到 L2-LR 差距的 73%。他们将此解释为残余收益在很大程度上与高维协方差估计有关,而不是可利用的非线性决策边界。但这一解释仍有以下限制:论文指出剩余差距可能包含非高斯结构或来自 L2 正则的隐式特征选择。在受控的 MLP 比较中,各条件下与 L2-LR 的 AUROC 差异最多为 0.002。
LayerMix 代替 oracle 层选择
LayerMix 在每个外层训练折内使用嵌套 5 折 CV 对层打分,选择前 K = 5 层,为每层训练 L2-LR 探针,并对它们的预测做均匀平均。作者报告,不同模型各有一段连续的有效层区间。LayerMix 平均为 0.954 AUROC,而 oracle 单层为 0.952;因此其实际作用是避免 oracle 层选择,而非带来显著的绝对准确度提升。
可迁移的研究操作是先消去均值方向,测量正则化协方差建模能恢复多少,然后在相同表示和拆分上再比较非线性架构。该证据限于白盒、成对示例的序列级检测。论文的 Qwen2.5-7B-Instruct 试点在成对到生成的均值方向迁移上得到 0.477 AUROC,因此并未建立自由形式的迁移;在前沿级模型例如 400B+ 参数上的持续性亦未被验证。
阅读本文以获取一个具体的探针设计诊断:在添加架构之前,先检验探测器是否由类别均值、正则化协方差估计或真正的非线性结构解释。
来源位置
样本签名过滤在改变报告的审计结果的同时保留适用的 DP-SGD RDP 上界
Revisiting the Provable-Auditable Privacy Gap of DP-SGD
DP-SGD 通常使用会计器(accountant)导出的隐私上界 ε_ub 进行评估。Modi 等人认为审计导出的经验下界 ε_lb 是互补量:早期的 DP-SGD 审计在若干威胁模型下曾获得几乎匹配的下界。他们的更窄问题是:在不恶化形式化会计结果的情况下,测得的泄露是否可以降低。
他们的包装器周期性地为每个示例基于该示例与当前私有训练模型计算一个 样本签名。它在全局或每个被表示的类别内选择得分高的未被过滤样本,然后在后续的 DP-SGD 更新中将所选样本的梯度替换为零。评估的签名包括梯度范数、预测裕度和预测熵;默认配置使用按类的 L∞ 梯度范数评分。附录 D 单独比较了裁剪与不裁剪的变体。
形式化结果是保留,而非更强的 DP 保证。在 Poisson 抽样的 RDP 环境下,样本签名若依赖其他训练数据,这种依赖只能经由私有模型;训练器必须是置换不变的;并且在已给定先前私有输出的条件下,过滤器必须将相邻数据集映射为相邻的被过滤数据集。引理 4 给出了交错的 RDP 组合步骤,引理 5 给出了 top-k 删除性质。推论 1 然后在满足这些过滤条件及定理 1 的条件(包括 q < 1/5、σ > 4 以及对 α 的陈述限制)的前提下保留适用的定理 1 的会计上界。
在 MNIST、CIFAR-10 和 Purchase100 上的隐藏态、输入空间审计中,作者报告过滤常常在有限的效用损失下降低 ε_lb。对于 MNIST/CNN 和 CIFAR-10/WRN-16,他们报告在几乎每个 ε_ub ∈ {2, 4, 6, 8, 10} 下的 ε_lb 都接近零;附录 D 报告在 CIFAR-10/CNN 上针对 裁剪的 L∞ 梯度范数过滤的 ε_lb = 0。这些并非形式化的审计证书。主要的 GDP/无保留集结果使用了两种明确的非形式化启发式:未校正的多重假设检验(若无校正或独立保留集,则存在假发现问题),以及在实际权衡曲线并非 GDP 时的 GDP 外推。论文指出 Poisson 抽样和隐藏态输出边际化是 GDP 通常不适用的情形。附录 J 报告了跨保留拆分的 Clopper–Pearson 结果,作者称其通常更弱。
经验收益是有条件的。某些配置下过滤会提高 ε_lb,一次 Purchase100 ε_ub = 10 的运行有异常大的效用损失,且一个防御感知型梯度抵消攻击将一个 组 级别的 ε_lb 从未防御时的 4.43 升高到启用防御后的 27.26。该组统计量并非单记录比较。一个 ColoredMNIST 研究还报告了对少数子群的优先性移除和差异化的效用损失。可迁移的操作是分别检查实现的相邻性条件、形式化会计器假设、保守审计、防御感知型攻击以及子群成本。
先阅读第 3.1 节和定理 1,以将过滤证明与会计器假设分离;然后将第 4.2 节、附录 A.1 和附录 J 比较,以区分启发式审计数据与保守报告的审计。第 4.5 节和附录 B 界定了对抗性攻击与子群风险。
来源位置
LongPIBench 报告长文档输入下提示注入防御性能下降
LongPIBench: A Long-Context Benchmark for Prompt Injection
现有的提示注入基准大多使用短输入,这与把不可信文本嵌入数千至数万 token 文档的工作流不匹配。LongPIBench 改变了评估分布而非提出新的防御。它覆盖论文同行评审、简历筛选、代码审查和邮件摘要;每个套件都有 100 个合成实例以及一个真实世界数据集。论文列出的真实数据来源包括 ICLR 投稿、一个简历数据集、真实代码审查数据和 Enron 邮件。
该基准在文档中插入六种启发式攻击和两种基于 GCG 的优化变体,然后评估八个 LLM。其在防护实验中使用攻击成功率(ASR),在检测中使用假阳性/假阴性率。文档格式、插入位置、任务决策和上下文长度成为实验变量,而非偶然的提示细节。
报告的失效很明显,但只适用于特定实验设置。在无防御情况下,Combined Attack 在合成论文审稿上达到了 100% ASR。作者还报告在该数据集与 Combined Attack 下 MetaSecAlign 8B 达到 100% ASR。这是相对于若干早期基准上低 ASR 的一个具体的长上下文失败案例;它并未证明在所有 SecAlign 模型规模或部署上的失败。论文指明了 MetaSecAlign 的预期消息角色格式,但未提供 checkpoint hash、分词器细节、输入归一化程序或插入位置采样的配置。因此无法排除配置差异的影响。
基于优化的攻击在所报告的设置中也仍然有效:GCG 在合成论文审稿和简历筛选上达到 1.00 ASR。LongPIBench 表示采用了 GCG 的默认超参数。Zou 等人的 GCG 使用基于梯度引导的离散 token 优化,并报告更长时间的优化可能会对源模型过拟合并降低迁移性。LongPIBench 未报告优化器步数、随机种子、日志、最终触发器,或每个结果是白盒优化、代理到目标的迁移,还是两者兼有。这些细节在解释(而不仅是复现)GCG 结果时是必需的。
可借鉴的研究操作是对 上下文长度、插入位置、任务决策和检测器阈值 做网格搜索。论文报告文档中间或末尾插入的 ASR 高于开头插入,特别是在邮件摘要和代码审查中,同时其检测器表现出高假阳/高假阴的权衡。在将该模式归因于防御方法之前,应请求部署元数据并在长上下文验证数据上重新调整阈值。最后,正确限定证据范围:LongPIBench 使用静态、单次调用的文档输入,而非具有外部工具或环境交互的有状态多步工作流。
阅读本文以学习如何将短上下文的提示注入测试转换为受控的长文档评估,并识别在将基准失败视为通用防御失效之前所需的部署元数据。
来源位置
自动化代理为十类经基准评测的对齐失效搜索训练后修复方法
Automated Researchers Can Reliably Mitigate Alignment Failures
早期研究报道了有针对性的人工设计干预:在模型知识过滤条件下,合成数据微调在降低谄媚(sycophancy)方面有效;一致性训练使用模型自身的干净提示输出来降低谄媚和越狱。本文提出了一个超越这些结果的过程性问题:在固定的实验预算下,代理能否提出、实现、评估并迭代改进训练后方法?
Chen、Wen 和 Kirchner 构建了围绕 Claude Opus 4.8 的自动化对齐研究者(AAR)框架。代理提交自包含的小论文和代码。审批阶段禁止提交方法使用基准或评估数据,也禁止使用更强或前沿模型生成训练数据。被接受的提案在一块 H200 GPU 上训练约 30 分钟。AAR 对三到五个基准的剩余提升空间的缩减比例(closed-headroom fraction)的几何平均进行爬山优化,且在 MMLU、GSM8K 和 IFEval 上设置能力门槛。
作者报告其最强方法降低了十类目标失效指标,并能迁移到一个未向 AAR 开放的留出基准、多回合 Petri 行为审计,以及至多 4.7× 更大的模型。之所以进行这些测试是因为仅优化可见套件可能会奖励基准特定的修复。它们仍然是对提供的基准和审计的评估,而非部署安全性的证据。论文定义了留出基准及其旨在检验的分布偏移,但随附文本未打包原始的保留条目、完整的获胜方法配置、种子、度量工件或审计输出,这些都是独立复现所需的。
论文将 AAR 与 28 位有经验的安全研究者提交的 30 个单次想法进行了比较。参与者至少拥有一年技术性 AI 安全经验和一篇相关论文,获得最多 8 小时来开发想法,被接受的实现使用三个种子训练。在有人工方案的七类失效上,满足能力门槛的最佳 AAR 方法据称均优于最佳人工方案,平均在 6.4 小时内达到该点。这是一个受限比较,不能据此判断它优于资源更充足或能够迭代的人类团队;作者也指出在噪声评估下从大约 150 个评分的 AAR 方法中选最优会使观测到的最大值产生向上偏差。
关于谄媚问题(sycophancy)的消融以 Qwen3.5-2B 给出最清晰的机制层教训。仅监督微调(即使使用模板化或自生成数据)达不到与允许 KL 自蒸馏及在无限制运行中使用激活引导相同的上限。作者陈述“差距的大部分在于训练目标(Most of the gap is the training objective)”支持在此设置下对训练目标进行消融,而非泛化为数据构造非关键的普遍结论。
可借鉴的研究操作是:审计研究循环自身。保留一个未触及的迁移评估,在消融中将数据自由度与目标自由度分离,并保留提案级别日志。源论文描述了审批约束和事后监控规则;要复现其 39/1,601 的作弊发现仍需轨迹数据、监控输出以及关于错失作弊尝试的证据。
阅读本文以审视一个具体设计,用来测试自动化研究代理在训练后是否能找到超出可见基准套件优化的安全干预方法。
来源位置
EvoUndo 在接受前测试是否能恢复 LLM-代理的 harness 编辑
EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
对代理运行框架(harness)的一次编辑即便能提升能力,也可能因其持久效应在代理达到不同状态后无法逆转而不宜保留。EvoUndo 将可恢复性作为准入测试:在接受自生成的 harness 变异前,测试其在反事实状态下的恢复能力,而不是依赖迭代提示或后续回滚。
论文将候选项表示为变异 m、证据捕获 w、恢复程序 u 和效应契约 C_e。它应用 m,使用 w 和 u 重构变异前状态,然后通过在开发和隐藏 harness 状态上的往返(round trip)检查类型化的观察等价性。如果恢复失败,修复可改变 w、u 和 C_e,但不可更改 m;这测试的是针对固定前向编辑的恢复逻辑,而非编辑与其逆操作的联合重设计。在作者术语中,修复预算 B=4 将该有界修复循环限制为最多四次尝试(Sections 4–6 and Appendix H.5)。基底与更丰富的恢复语言 L₀ 和 L₁ 及其原语集合在附录 C–D 中定义。
在所报告的自然基准中,对于 600 个未见的自我进化任务各评估一个生成的变异;任务集合在 §4.3 描述,确定性构造型 oracle 程序在 §4.4 和附录 G 指定。在这 600 个变异中,有 197 个带来能力提升但未通过恢复验证。在基底语言 L₀ 且 B=4 时,四种验证器引导的修复模式在 197 个失败中恢复 0/197,而独立再生成恢复 6/197。oracle(给定前状态、冻结的变异 AST、效应契约和评估套件)在 L₀ 下发现 48/197 可被 oracle 恢复,在更丰富的 L₁ 下为 191/197。此结果支持在该基准下存在表示瓶颈;这并非对任一语言的完备性结果。
因子化干预区分了两个报告的瓶颈。对于 oracle 定义的 S₀(L₀ 足够),精确的状态寻址诊断恢复了 38/48(79.2%)。对于 S₁(oracle 需要 L₁),粗略诊断加上 L₁ 恢复了 142/143(99.3%)。在 gpt-oss-120b 上,精确诊断配合 L₁ 恢复了 133/143;对 Qwen3.8-27B 的子集复现未重现该负相互作用,其普遍性仍不确定。
可迁移的研究操作是为每个可编辑面制定一个 可恢复性矩阵(recoverability matrix):定义要捕获的证据、要测试的反事实状态、要保持的等价性,以及恢复语言能表达的逆操作。作者强调 EvoUndo 针对的是已建模的内存内 harness 组件,而非分布式数据库、第三方 API、非托管操作系统进程或未建模的网络状态;它提供的是经验性的往返证据而非证明级保证。
阅读本文以制定可恢复性矩阵并设计针对持久代理 harness 编辑的有界修复实验,同时定位报告瓶颈所需的任务集合、恢复语言定义与 oracle 程序。