让大模型给出出处,正在变成合规与审计的硬要求。站内 AI 智创简报 #10 梳理过逐句举证方向的专利簇:大厂在圈地让 AI 答案带上引用凭证。2026 年 10 月 8 日提交到 arXiv 的论文《Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness》 从技术面打了这个缺口:引用凭证不等于决策依据。作者 Sadhu、Arora 与 Seth 在七个开源权重模型(8B 到 70B)和四个法律与合同基准上测试,要求模型点名适用的法律权威时,点名正确率有 66.7% 到 100%;但案情一字不改、只把被点名的法条或判例换成不相关的那一条,判决很少跟着换。
案情不动,只换被点名的权威
法律场景里,模型在判决书或合同推理之后「点名法条或判例」,通常被当作这条权威就是决策依据的证据。论文的审计设计绕开了对推理文本的信任问题:案情保持不变,把被点名的权威替换成不相关的法条或判例,观察判决是否随权威一起变。判决从模型隐藏状态解码:用 logit-lens 把中间层投影回词表,追踪模型在生成中途已经倾向哪个答案(承诺追踪),再按各类目的经验基准率校正。
为了排除提示词噪声或统计假象,论文做了多重稳健性检查:无混淆重采样(剔除类目难度差异)、案情同义改写、成对选择任务,以及把权威换成空值的对照,结果方向在各检查下一致。
点名正确率与判决改变率的缺口按数据集分列
换掉权威之后判决会变的比率,在三个数据集组上差异很大,论文按数据集分列报告,没有合并:CaseHOLD 上的判决改变率只有 0.0% 到 21.7%,也就是多数模型换了法条答案照旧;ECHR 与 SCOTUS 两个判例基准上是 30.0% 到 76.7%,中间水平;ContractNLI 合同基准上是 43.3% 到 50.0%,最接近「点名确实影响结论」的样子。同一批模型,引用对结论的约束力随数据集体裁波动。
论文把这解释为两阶段假说:模型先按套话把权威念出来,再按案件事实做决定。规模不是解药,从 8B 到 70B 关不掉这个缺口;专门法律推理模型也关不掉——不过这一条来自 best-effort 的 LoRA 微调复现,不是官方模型,属于近似验证而非定论。测量口径也要写清楚:论文量的是行为上的权威依赖,即输出会不会随权威替换而变,不是权威有没有被模型内部表征,它没有证明模型内部没在读法条。
红队评测里,藏在案情里的指令比法条管用
红队评测暴露了更扎眼的对比。在五个核心模型上,藏在案情里的对抗指令遵从率达到 73.3% 到 96.4%,远高于这些模型对替换权威的敏感度,且五个模型无一例外都是这个方向。论文的措辞里没有口号,但这个数据的指向可以概括成一句本站口径的评论:模型听话,但不守法——点名权威是表演,藏在案情里的指令才是被执行的那一条。
需要交代的是,这篇论文截至提交时没有评审场合标注,摘要页也无机构落款,按预印本口径对待,结论仍需同行评审与独立复现检验。但这对审计的提示已经很具体:商业面上,简报 #10 的专利簇在把「答案带出处」做成产品与壁垒;技术面上,本文说明出处本身不证明依据。两篇合起来读才是完整图景——如果合规只验收「有没有引用」,这条验收线根本探不到判决是怎么形成的。