2026-09-20
2026-09-20
Transported Conformal Calibration 将有标签校准转移到配对目标空间
Conformal Calibration Transfer
保形预测通常在校准数据与部署数据可交换的条件下获得覆盖保证。“Conformal Calibration Transfer”研究了该条件不成立的具体情形:有标签的校准仅在源空间可用,而需要在一个不同的、由未标注配对观测连接到源空间的目标空间中构造预测集。
TCC 将这一迁移过程明确化。它利用配对数据把有标签的源域校准“运输”到目标空间,然后仅使用未标注的目标输入对运输后剩余的不匹配进行校正。TCC-KS 使用无需标签的不确定性替代量来检测不匹配并保守地调整校准;weighted-TCC 在权重稳定时将运输后的校准按权重重加权以提高效率。论文给出随可观测不匹配度量自适应的有限样本目标域覆盖保证。
该体系同时声明了其边界。论文的不可能性结果指出:若没有将可观测量与未观测真实标签得分分布结构性耦合的假设,则任何无需标签、分布无关且承诺目标边际覆盖的程序在最坏情况下都可能近乎空洞。TCC 需要未标注的配对观测来连接源与目标输入;在没有此类配对的情况下,该框架不适用。
经验证据是有针对性的,而非普遍性的。在 CIFAR-100-C、Tiny-ImageNet-C 和 SEN12MS (SAR->RGB) 上,作者报告了在没有有标签目标校准数据的情况下可靠的目标域覆盖迁移,且给出了能预测何时需要校正的无标签诊断。评估仅使用持出有标签目标集作评估。在论文的 328-configuration 审计中,delta+ 与集合大小膨胀的相关为 0.772,与安全裕度的相关为 0.734,支持其作为部署信号的可用性。
可迁移的研究操作是将运输学习、校准和不匹配估计分离开来,然后问所选的无标签替代信号是否跟踪影响覆盖的失败模式。在该信号可信时采用保守的 KS 路径;仅在权重稳定性被证明时才将加权视为提高效率的选项。这是一个建议而非保证:对替代量不可见的漂移在没有目标标签时本质上难以检测,所给的保证是边际的而非条件的,当未标注样本预算很小时,明确的样本拆分会降低有效样本量。一个有用的复现问题是:在新的配对传感器变化下,同一诊断是否仍具预测性,而不是假设仅凭运输质量就能保证校准有效性。
阅读此文以了解配对未标注观测如何支持保形校准迁移、在何种情况下基于替代量的校正比加权更安全、以及哪些假设与诊断决定该保证是否有信息价值。
合成数据微调提高了分布内技能检索,但可能在真实与分布外任务上导致灾难性遗忘
When Synthetic Data Hurts: On Catastrophic Forgetting in Skill Retrieval for LLM Agents
早期合成检索工作已报道来自生成监督的提升:InPars 发现按语言模型生成似然过滤生成对可以提高重排序器效果,而 Promptagator 发现往返过滤平均可将密集检索提高 2.5 nDCG 点。本文提出一个相邻的部署问题:这些增益是否能在合成训练分布之外保留检索能力?
在一个包含 34,396 个技能的生产技能路由器上,作者将有限的真实监督与合成监督进行比较,并在真实、分布外 (OOD) 与合成分布内任务上评估检索。激进适配下失败是显著的:在报告的配置中,OOD 召回从 0.850 降至 0.650。
方法上的改变是加入保留(preservation)控制,而不是仅以目标分布分数来评判合成微调。Embedding-anchor regularization 惩罚调优后正例技能嵌入与被冻结编码器之间的偏离。对于重排序,listwise Learning without Forgetting (LwF) 将学生模型的分数分布正则化向被冻结的教师模型(teacher)。该研究还评估了 Elastic Weight Consolidation (EWC) 和 L2-initialization,并比较了保守与激进的 LoRA 配方。
报告的结果是有条件且有用的:评估的保留方法在保留 OOD 技能检索性能的同时,将合成分布内检索提升了 13.98%(针对 0.6B Qwen 检索器与重排序器)。因此,证据支持将这些训练配方作为待测试的做法,而不是断言相同超参数必然可迁移到其它模型或目录。
边界条件很重要。Val-set 1 有 21 个例子且 Val-set 3 有 10 个,所以单任务变动可使 Recall@10 大约变动 5%。在 Track B 中,仅有 26,947 个可检索技能中的 140 个——0.52%——出现在锁定训练集的正例中。两个合成流水线也依赖于商业的、权重封闭的大型语言模型来生成样本与评估质量。
一个可迁移的实验设计是:保留一个冻结的适配前检查点(pre-adaptation checkpoint)和一个锁定的真实/OOD 持出集,然后比较三条分支——仅用合成数据、保守-LoRA、以及带独立正则项的方案。并行报告目标分布增益与真实/OOD 的差异,扫参 LoRA 的秩(rank)与正则化强度,并检查逐任务变化。关键研究问题是,当正例覆盖率、合成数据质量或目录规模发生变化时,保留方法是否仍然有效;这是一个编辑性质的实验设计建议,而非论文已确立的普遍结论。
阅读此文以学习如何测试合成监督是否在改善检索目标的同时暗中损害真实与 OOD 行为,并抽取一个针对稀缺多正例技能路由数据的具体 LoRA+保留(preservation)实验方案。
abstract; S1.p3; S4.SS1.SSS0.Px2.p1.1; A4.T10; S2.SS5.SSS2.Px1.p1.1; S2.Ex1; S2.SS5.SSS3.p3-p4; S4.SS2.p1.1; Table 4 · S3.p3.2; S6.SS3.p1 · S3.SS2.p2; S4.SS3.p2; Figure 2 caption (S4.F2);
配对二项式审计在合成诊断中接纳持续性策略更新,而基于范围的门控予以拒绝
When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents
Ma 和 Wu 将更新准入表述为一个联合要求:在给定交互预算下控制错误同时保留有用的学习机会。论文的具体可行性失败是同时的 Hoeffding(或基于范围的)门控,即便在观测到的旧任务结果无变化时也可能要求过多的新鲜配对评估。
在论文示例条件下数值对比很鲜明:在三个受保护比较、首次尝试分配、以及错误和保留裕度为 0.05 的设定下,范围构造每个比较需要 4,229 对;等分配因此需要 25,374 次试验,超过 20,000 次上限。作者提出的替代方法是在配对评估内计数正负结果的不一致并应用单边 Clopper–Pearson 界。当两个不一致计数均为零时,保留条件在同一示例下只需 117 对,而非 4,229 对。
操作性变化是使审计明确为配对且在候选更新提交后进行新鲜采样。所述保证假设已提交的配对在每个任务内独立同分布,且策略与评分保持冻结。在该契约下,顺序推进诊断发现配对门控在 2,000 次试验上限下接纳了 256 次尝试中的 81 次——31.6%——在 20,000 次试验下接纳了 256 次中的 229 次,而 Hoeffding 门控未接纳任何一次。诊断中未观测到契约违规,但论文并不以零观测违规来断言零错误率。
该结果并不等同于解决学习机会问题。在闭环运行且每阶段 2,000 次试验时,配对检查漏掉了 60.4% 的可用机会,且回放获得了更高的最终成功率。这使得漏失机会率成为有害准许检查的必要伴随度量:一个审计可以足够保守以保护参考策略,却仍然阻碍其应当监督的学习过程。
对于实现,需用相同的候选流和交互上限复现比较,记录新鲜配对的使用与每轮准许情况,并同时报告观测到的违规与漏失机会。将该规则视为可测试的协议设计,而非机器人验证:论文声明所有示范、动态观察、策略更新与评估均为合成,实体机器人与 VLA 验证仍然开放。该规则仅支持二元评分;物理状态传递、相关的重置配对、可选停止或在批次中改变策略或评分函数都会使其陈述的假设无效。
阅读本文以了解配对不一致性检验如何在降低持续更新审计成本的同时暴露安全导向准许门可能造成的学习机会丢失。
自我共识在所研究的安全且节省令牌的早退门控上失效
Stable Answers, Unfinished Reasoning: Why Self-Consensus Is Not a Safe Early-Exit Signal
对单一部分推理轨迹反复探测当前答案看起来像一个廉价的停止检验:当最近的探测一致时就停止。具体的限制是语义性的:在固定探测程序下达成的一致性只能证明当前答案在该程序下保持不变,而不能证明推理已终止。作者将此称为“共识—终止差距”。
论文的方法变化是用预注册审计替代对该代理信号的信任。作者在两个模型与三个基准上对冻结轨迹重放了 3,520 条窗口共识规则,探测输出计入令牌费用,且三个接受门控预先固定。一个边界置信度控制 DEER 在同一管道中进行扫描;与共识规则不同,DEER 清除了所有三个门控。
决定性证据在于何时出现一致。用两种不同措辞的答案查询对轨迹进行配对再探测,在轨迹前十分之一处,两次探测返回不同答案的比例为 54%,而在最后三分之一处仅为 16%。在一个 134 个样本的手工标注的“已停止但错误”集中,56.7% 的案例是模型尚未收敛的答案,18.7% 是探测格式引起的伪影,只有 24.6% 是确实已定但错误的值。在仍节省 32% 令牌的规则下,九次停止中就有一次触发在后来被轨迹放弃的答案上。扩大一致窗口并不能消除该问题:非终止比例在约 7% 附近趋于平稳,而令牌节省降至 8%。
该结果是有范围的经验负面发现,而非不可能性证明。中心搜索使用了一个固定答案探针后缀和一套 3,520 条共识方案;其他探针措辞和信号并未被穷尽搜索。基准为可核验最终答案的竞赛数学问题,因此向开放式推理、代码或具代理性的任务转移仍在范围外。该分类法也是探索性的,来自一个环境与短窗口设定。
对于新的推理时控件,应将“答案在该探针下当前稳定”与“推理已完成”区分开。一个有用的后续实验是直接变更探针措辞与依赖性,然后在持出轨迹上测试一个表观停止是否先于修正发生。报告安全性与令牌成本并列,计入探针本身,并将所提信号与结构上不同的控制进行比较,而不仅仅是调节更严格的一致性。
阅读此文以学习如何区分在探针下稳定的中间答案与推理轨迹实际完成之间的差别。
Abstract; S5.SS2.p1 · Abstract / S4.SS2.p1
条件 Shapley 推断采用 U-统计量去偏:共线性与尺度边界
Semiparametric Inference for Conditional Shapley Feature Importance
论文指出两条常见 Shapley 工作流的局限:多数估计量只给出点估计而无不确定性;当特征相依时,从边缘而非真实条件分布对被排除特征进行采样会导致重要性错配。研究目标是一个基于损失的全局条件 Shapley/SAGE 重要性,其中被遗漏特征按其真实条件分布积分。
核心估计量是一步法的 K 折交叉拟合局部 Shapley 贡献均值。对于平方损失,作者将条件抽样分成两个独立的蒙特卡洛子批并采用类 U-统计量的校正,以消除朴素插入式(plug-in)损失估计随样本量产生的方差偏倚。条件采样由一个工作 Copula 驱动,默认为高斯 Copula,同时可选 vine copulas。论文陈述在双稳健(double-robust)速率条件下,估计量为 root-n 一致且渐近正态,从而支持基于 Wald 的区间估计。
论文同时显式考察模型误差。借助一个 Pinsker 型界,在有有界性与全变差(total-variation)正则性假设下,作者给出真实目标与工作 Copula 类中伪真实目标之间差异的上界,该上界为常数乘以 Copula KL 散度的平方根。因此,当 Copula 被参数化地错配且存在非零 KL 赤字时,置信区间将以工作类中的伪真实参数为中心,而不会自动以期望的真实目标为中心。
主要的模拟证据是在低维高斯设计下得到的。设 p=5, n=500,线性预测器且可部署的高斯 Copula 估计器使用 K=3, M=30, B=20,经验 95% Wald 覆盖在各特征间为 0.91 到 0.96。报告的第一类错误约为 0.05,在局部备择 δ=0.25 时拒绝概率约为 0.988。对 UCI Concrete 与 California Housing 的应用在 α=0.05 下报告所有八个特征经 Bonferroni 校正后均显著。
论文指出最尖锐的边界是依赖性:当特征相关 ρ=0.9 时,条件 Wald 区间出现欠覆盖,并且在所报告的实验中该欠覆盖随样本量增加并未改善。作者将这一现象归因为接近奇异的条件化与对插入式影响函数变异性的低估。计算开销也是一个限制:作者估算朴素代价大致为配对 Copula 方案拟合 O(p²) 与每次评估 O(p³),使得 p≳100 时计算变得昂贵。
一句可迁移的研究操作是:检验条件采样的随机性是否进入非线性损失,随后在交叉拟合采样器的同时比较朴素插入式估计与使用独立子批的 U-统计量校正。随着特征依赖增强进行覆盖率压力测试,并报告所用 Copula 类及其错配风险,可将单纯的归因估计扩展为更可检验的不确定性推断流程。
阅读此文以学习一种可复用的去偏蒙特卡洛损失方法并交叉拟合条件采样器,同时检验 Copula 错配、共线性或维度是否使所得不确定性估计失效。
