目标文档前缀的概率审计,不能排除触发词提取
Memorization Is Not Extraction: Tight Differential-Privacy Bounds and Audit Blind Spots
研究者让同一段待保护的秘密接受两种不同检查:审计者只看模型在目标文本已给前缀后为后续词分配的概率,或由此计算的损失;攻击者则可以换用另一个提示词寻找秘密。论文发现,前一种检查即使显示目标前缀无法复述,也不能排除后一种提示路径完整取回内容。这会改变对“审计通过”含义的判断:它首先只覆盖实际检查过的提示通道。
已有工作已讨论可区分性与提取风险并不等价,但资源限制和攻击游戏并不相同。本文把“局部评分”限定为只能读取目标文本各个已给前缀后,模型为后续词分配的概率;攻击者可以自适应地查询模型,却不知道秘密内容,最后只能提交一份长度有限的候选答案列表。
作者用成对训练数据集做反事实对照。第一条训练分支中,数据供应方读到由目标前缀和秘密组成的目标记录时,才植入“触发词接该秘密”的文本。第二条分支中,供应方读到相同目标前缀配上另一个独立秘密时,不植入这段触发文本。两条分支都不直接把目标记录用于训练。因此,若只有第一条分支能由触发词复述秘密,差异可归因于供应方是否按所读记录条件性植入了触发文本;攻击流程本身不能利用事先知道的秘密来构造提示、解码或候选列表。
在 Pythia-1.4B 和 Qwen2.5-1.5B 的普通微调中,所有测试长度下,从触发词提取秘密的比例至少为 0.98,从目标文档前缀提取则为 0;直接把目标文档插入训练集的对照组可从原前缀复述,说明该测试本身并未失灵。记录级反事实实验也得到“含记录分支触发词可提取、无记录分支不可提取”的一对结果。它支持的结论是:原文前缀上的提取测试和局部概率评分,会漏掉异前缀触发通道。
边界同样重要。普通训练模型的局部评分信号只是衰减而非严格为零。影子模型成员审计通过训练参考模型比较样本是否被拟合;论文中它检出的是触发完成记录及其所含秘密 token 的拟合信号,而不表示目标记录本身被直接用于训练。对任何只沿目标前缀打分的方法都严格不可见,则来自显式构造和服务层门控发布。可迁移的操作是把原文前缀复述、局部损失审计和异前缀提示提取分列评测。对于提交候选列表的提取,还应另报攻击者完全不用模型、只按其已有侧信息和语料余量给出最可能的 m 个答案时,秘密落入该列表的概率(top-m 先验命中率),以区分模型带来的增益和攻击者原本就能猜中的部分。
查看图 10–11:同两个模型家族的两组实验分别展示触发词与原文前缀提取,以及记录级反事实对照,能直接核对“换提示路径”带来的差异。
来源位置
同一剪枝流程下,适配器更新得到更小的行为电路
Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit
研究者把“在冻结模型里寻找行为电路”的流程改成后训练:逐步删去内部组件之间的连接,同时让模型仍完成指定行为。这改变了一个研究判断:发现到的大电路既可能反映原有布线,也可能说明该行为尚未被训练得集中。论文用一项只改动“能否更新适配器”的对照,检验缩小究竟来自权重重塑还是搜索策略。
作者把组件间的连接视为候选电路边;关闭一条边时,会用一条配对的、答案应不同的提示所产生的内部信号替换它。每轮依据这种替换对指定行为的影响为边打因果归因分数,先删去低分边;再只训练附加在冻结基座模型上的低秩适配器,即一小组可训练参数,让模型经由剩余连接拟合原模型的下一个词分布。可更新组训练这组适配器,冻结组则保持它不变。验证集上的掩码电路和门全开的适配模型都须保持目标行为;另在独立的非目标能力探针上,只要求门全开适配模型的适配器开启/关闭困惑度比不超过阈值,失败便恢复到上一次状态。此前的冻结发现方法只在既有权重中搜索;这里增加了“剪枝—蒸馏—验证—回滚”的闭环。
关键对照把排序、删边日程、验证和回滚全部固定,只让一组更新适配器,另一组保持权重冻结。在四种行为、八个模型中,冻结组在 32 个任务—模型组合(各组合取三种子中位数)里有 29 个留下更多边;全部 96 个种子运行的冻结组与可更新组边数比的几何均值为 7.4 倍。这支持较窄的结论:在这套控制器下,适配器更新使指定行为能集中到更小的连接集合,不能据此断言找到了全局最小电路。
这个电路首先描述的是后训练后的模型,且“边数”只在这种反事实内部信号替换的测试定义下成立;适配器仍覆盖全模型,论文也未报告推理加速。可学习的研究操作是把冻结组与可更新组置于完全相同的搜索控制器中,只切换权重是否可变;随后再把缩小结果用于子集枚举或边对消融,检验小图是否真的更容易审计。
查看表 1,可以直接核对冻结对照与可更新组在相同控制器下的边数差异,并判断“权重更新驱动缩减”的证据范围。
来源位置
共享置换随机性后,平行分析仍随等价隐藏坐标改变
Representation Measurements Under Function-Preserving Reparameterizations
研究者先在语言模型相邻权重中补偿正交旋转,使模型的输入—输出行为保持不变,再检验隐藏表示的“平行分析”会不会随坐标系改变。他们发现,即使上下文表示的协方差谱不变——也就是各个彼此正交的变化方向所承载的方差大小不变——平行分析选出的成分数仍会大量变化。因此,若把该数目或由它导出的阈值决策解释为模型函数、或检索证据本身的属性,就需要先通过这类不变性检验。
平行分析把观测到的协方差特征值,与“逐列独立打乱”表示后得到的参考特征值比较,以决定保留多少方向。此前的置换平行分析同样依赖这种逐坐标操作;本文增加的是把函数保持旋转作为受控负对照。旋转不改变原协方差的特征值,却会改变每个单独坐标承载的方差;逐列置换保留的正是这些坐标边际,参考分布因而随坐标系变化。
最有力的验证去掉了逐坐标标准化,只保留中心化,并让旋转前后使用同一批置换随机性。四个采用 RMSNorm 的模型、三个检索领域共 1,200 个上下文中,旋转前后的观测谱最大相对误差仅为 1.26×10^-6,但有 1,141 个上下文的成分数改变。这个对照将变化定位到置换参考,而非观测谱或两次蒙特卡洛抽样的偶然差异。它不说明所有旋转、任务或更大模型都会有同等幅度;实验使用的是特定的结构化旋转。
可迁移的研究操作是:若指标声称描述函数或证据,先写清允许的函数保持变换;随后在原表示和补偿变换后的表示上共享随机参考,分别记录观测谱、参考阈值与最终选择。若目标确实要求对共同正交旋转不变,本文提出的替代评分可使用上下文表示彼此之间、以及上下文与答案表示之间的两两内积,也就是它们的相对几何关系,而不使用单个隐藏坐标的边际;这些信息在共同旋转下不变。
查看论文 Table 4:它将独立置换种子重跑与共享随机性的 centering-only 对照并列,最直接地验证成分数变化来自参考分布。
来源位置
学习率随 β 反向调整后,近同 DPO 损失仍可对应近三倍 KL
Disentangling Optimization Scale from Preference Scale in DPO
DPO(直接偏好优化)是这里用来做偏好微调的训练目标:它根据一对“偏好回答”和“非偏好回答”更新模型,β 决定这类偏好差异以多大的尺度进入目标。研究者把 β 与学习率配对调整,检验训练曲线究竟在报告策略学到了什么。结果显示,两次训练的 DPO 验证损失几乎重合时,模型相对参考模型的偏移和下游表现仍可相差很大。因此,用各自 β 计算的 DPO loss 不能单独用于挑选 β 配置。
标准 DPO 的梯度含有 β:β 一面改变偏好损失随回答差异变化的形状,一面在普通 SGD 中通过梯度直接放大或缩小单步更新;自适应优化器可能部分抵消后者。本文的增量是将这两个作用分开处理。作者使用居中 softplus,即把同一 DPO 目标除以 β,并平移数值基线使训练初始值为零。对任何固定的正 β,这只是目标的仿射重标定,最优解不变;但在有限步训练中,梯度不再随 β 被直接放大或缩小。使用 SGD 时,若将该重标定目标的学习率设为标准 DPO 学习率乘 β,两者才会匹配更新尺度。这是用于重标定和诊断的工具,不证明它会得到更优的最优解。
主证据来自 Qwen3-4B 的 LoRA 偏好微调:在 UltraFeedback 上,作者比较 β 为 0.01、学习率为 0.001,与 β 为 0.02、学习率减半的两组 SGD 训练,均运行六轮、各四个随机种子。参考 KL 用来量化训练模型的生成分布偏离参考模型多少,因此可检验损失相近的模型是否实际仍是不同的策略。两组从第一轮起的验证损失最大只差 0.0051,但最终每 token 的参考 KL 分别为 0.814 和 0.278,接近三倍;长度控制的 AlpacaEval 胜率也相差 13.76 个百分点。这里的下游评测使用模型裁判,且这种损失重合并非所有数据集都会出现,却足以说明损失曲线会压掉 β 所对应的实际边际尺度。
编辑建议:跨 β 诊断时,不要只用各组按自身 β 计算的 DPO loss 选择配置;可像本文那样同时查看固定尺度的留出 pair NLL(文中取 β=1)、策略对偏好回答与非偏好回答的对数概率差、扣除参考模型后得到的 margin,并辅以相对参考模型的 KL。是否纳入下游评测、如何设置 β 与学习率网格,仍需按任务验证。居中 softplus 在本文配对案例中能让这类轨迹分开,但尚未证明它可作为任意 β 设置之间通用的质量刻度。
查看附录 H 的表 H2,可直接核对学习率按 β 反向调整后,验证 DPO 损失近同而 KL 明显分离的关键对照。
来源位置
同一人工切分下,保留续接价值比吸收终止高20个百分点
离线目标条件强化学习会从记录轨迹中抽取未来目标,并用多步回报训练价值函数。研究者在已知仍会继续的非终止位置人为切开轨迹,比较两种处理:把切口当作终止,或停止累计切口前奖励后,继续利用已存后继状态的价值补全目标。结果显示,切分元数据的语义本身足以大幅改变最终到达目标的能力;数据管道不能把管理性分段直接当作强化学习终止。
早先关于时间限制的工作已说明,非环境终止的截断应保留价值续接。本篇没有提出新的贝尔曼规则,增加的是一套受控压力测试:原始轨迹标识仍用于未来目标采样,转移、目标采样、优化和评测保持一致;人工切口只影响多步回报在哪里停止。CVT 条件在切口后从已存后继状态自举,也就是用该状态的预测价值补全回报;朴素条件将同一切口设为吸收终止。真实目标完成则在两组中都不续接。
主实验在 PointMaze 的五个任务中,对每种分段方案插入相同数量的 35,000 个切口,并用三个训练随机种子和三个切分方案比较。训练十万步后,CVT 的平均成功率为 39.1%,将相同切口视为终止时为 19.1%,配对差距为 20.0 个百分点;未切分数据为 50.5%。由于原始轨迹和未来目标分布没有改写,这个差距直接指向多步目标中是否保留续接价值。CVT 仍未恢复未切分表现,说明正确的边界语义不保证有限训练下严格不受切分影响。[论文§3.1–3.2、表1、§5.1]
可复用的操作是把“供采样使用的原始轨迹边界”与“供多步回报截断的边界”分字段保存。对带已知连续后继状态的人工切口,固定转移、目标抽样和随机数流,只切换续接掩码;再用同一个价值函数重构两类目标,检查差异是否符合预期。该检查不能跨真实重置、环境终止、缺失后继状态或目标完成使用,因为这些边界没有可续接的同一过程。
查看表1可直接核对同一批人工切口在续接与吸收终止语义下的配对成功率差,以及CVT未完全恢复未切分表现这一边界。