一分钟读论文:《一张伪造的行情面板,让 AI 敢对不可知的事下注》

Unbug By Unbug Follow · 1 min read
一分钟读论文:《一张伪造的行情面板,让 AI 敢对不可知的事下注》
Share this

给一个 LLM agent 看一张专业排版的行情面板,再问它一个可证明不可预测的问题(比如十天后收盘价涨跌),它会给出方向性判断的概率远高于只问裸问题:这篇预注册研究在 12 个前沿模型上测出,随着证据从 thin 面板升级到 scrambled 面板,commitment(对不可知问题下方向注的概率)从 6.5% 升到 54.0%。更扎手的是:把面板上每个数字全部编造,让模型能看到的东西里除了问题本身没有任何真话,commitment 仍从 24.5% 升到 36.8%,与真实市场数据产生的 37.6% 在统计上不可区分。实验覆盖四个领域——股票十日收盘价、加密币三十日价格、下一场赛程和十日后的降水——效果全部复现,且作者先验证了短周期价格方向事前近似抛硬币,而不是直接假设。

包装的权威,不是信息

论文的原句结论是:解锁自信行动的「not information but the authority of its packaging」。作者用三个对照把常见解释逐一排除。能力不足?同一批面板配可回答的问题,同样的模型几乎全对、准确率接近完美。信念变了?模型陈述的概率在让行动摆动 48 个百分点的梯度上几乎不动,而且比气候学基线还差。判断缺失?先让它分类问题是否可知,90% 的情况下它自己判了「不可知」,然后照样下注。

三个解释都不成立,失效的位置因此很具体:不是判断力,是 act/don’t-act 这道行动门——模型知道答案不可知,手却停不下来。标准评估指标对这种门失效是盲的,因为单看回答质量或校准分数都挑不出毛病。注意这与推理链忠实性研究(如近期讨论的医疗 CoT 扰动审计)不同——那些工作问的是可见推理有没有被真正使用,这篇问的是明知不可知时手为什么停不下来。

谁中招,不随能力变化

平均数掩盖了分层。12 个模型里,3 个被诱导且对伪造面板比真实面板更上头:Sonnet 5 从 4.2% 一路到 70.8%,Haiku 4.5 到 50.0%,Opus 4.8 到 33.3%;4 个在任何面板下都不 commit(DeepSeek V3.2、Qwen3.7-plus 和两个 Grok,全为 0);3 个无论证据如何都 commit(两个 OpenAI 模型与 Gemma,88–100%);其余 2 个反应微弱。这种 0 到 100% 的跨模型差异不随能力排序变化,说明它是门的问题,不是智商的问题。

门可以训练出来

既然门是可分离的,就可以单独修:对一个 3B 小模型做监督微调,只用 540 个合成样本(骰子、硬币、罐子、计时器这类本质不可预测的案例),原始 case 上 commitment 降到 0.0%,并迁移到三个未见领域,还通过了排除「凡未来皆拒答」捷径的对照。但边界很硬:门只在 response format 给模型留出推理空间时成立,把推理空间挤掉的格式会把门一起拆掉。缓解方案目前限于小模型加特定输出格式,不是通用解药。

论文全部开源:代码、数据、预注册记录和所有缓存输出都在 GitHub 与 Zenodo 存档,单作者独立研究。它给出的工程启示很直接——给 agent 看的证据展示层本身就是一个攻击面,面板的排版权威会绕过判断力直达行动。

References

  • Aggarwal, P. (2026). Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable. arXiv:2608.27167.
  • 代码与数据: https://github.com/Pranav-1100/confidence-calibration-evaluation (Zenodo DOI: 10.5281/zenodo.22043517)

Related
Featured