ai, security,

一分钟读论文:《遗忘审计的结论可能是统计量挪的》

Unbug By Unbug Follow · 1 min read
一分钟读论文:《遗忘审计的结论可能是统计量挪的》
Share this

一篇 2026 年 9 月提交的机器遗忘(machine unlearning,指从已训练模型中抹除指定数据的影响并重发模型)审计预印本《Published Unlearning Numbers Move Per Checkpoint, and Not Because the Removed Data Survives: An Audit of 263 Released Batch-Normalized Checkpoints》(arXiv:2609.11490,abs 页未标注机构)发现:遗忘审计的结论可能不是模型学出来的,而是统计量挪出来的——在 263 个已发布 batch-normalized checkpoints 中,权重保持逐比特(bit-identical)不变、仅用保留数据重新拟合批归一化统计量,就有 47 of 221 个 checkpoint 的指标移动超过其自身发布种子的散布,若干个还落在「方法平均值不动」的方法内部。动的是 checkpoint 的属性,不是方法的属性;被删数据幸存并不是原因。

数字为什么动:批归一化统计量是无人记录的自由度

批归一化(batch normalization,神经网络层间稳定激活分布的均值与方差统计量)几乎存在于所有经典视觉模型,发布权重时必然随附。论文的要害是:这些统计量不是任何梯度步写出来的,也没有发布记录交代它们如何拟合。审计实验把权重冻结在逐比特不变,只做一件事——用保留数据重新拟合这组统计量——已发表的遗忘指标就会移动。同一份权重配另一套拟合约定就是另一组数字,而合规判定读的恰恰是这些数字。这不是指控作弊:摘要口径是发布管道里存在一个无人记录的自由度,恶意与否不在审计射程内。

幸存假设被排除:交换实验几乎不动

「被删数据还残留在模型状态里」是解释指标失真的传统嫌疑,论文用交换实验把它排除了:在固定拟合池内把保留与删除记录的归属对调再拟合一轮统计量,若移动来自被删数据的残留影响,对调应当显著改变结果,实测已发表单元格几乎不动。与移动幅度相关的反而是另一个量——checkpoint 发布状态偏离任意一次重拟合的距离,离得越远,数字越容易挪出种子散布。嫌疑对象因此从模型记忆转向统计量的来源记录。

判定翻转的规模:12、4、2 分层

对已发表决定的实际影响,论文用三层数字限定:12 个 verdict(按发布指标得出的合规判定)发生翻转;其中 4 个移动幅度超过实测的重校准预算;只有 2 个在每一次重复中都稳定超过。作者另外训练并布点在一个贴近其自身判据的群体上,那里一个翻转都没有。处方同样克制:在这个通道存在的 batch-normalized 视觉模型上,发布数字时应在旁边注明拟合约定。

边界与未解问题

证据边界需要先划清。第一,这是未经同行评审的预印本,结论依赖对公开 checkpoint 的重拟合复现。第二,机制限定在带批归一化的视觉模型,不能外推到语言模型的遗忘评测——大模型场景是否存在同类通道,摘要没有任何证据。第三,翻转规模有限:12 个是总量,超过重校准预算的仅 4 个、全重复稳定的仅 2 个,读成「遗忘评测全线失效」超出数据支持。第四,它与已发的《推理链里的顿悟时刻,多半是预算给的错觉》同属「已发表数字不可信」批评轴,机制却不同:那篇病灶在测量侧——实验缺对照,结论是预算与难度的错觉;这篇病灶在被测对象本身——发布状态里藏着一个无人记录的拟合自由度,数字随约定移动而非随模型移动。前者靠补对照修复,后者只能靠发布时记录约定来堵。

References


Related
Featured