南加州大学的预印本《One Word Opens the Gate: The Option-Channel Attack on Typed Decision Models as Agent Guardrails》审计了七个开源权重模型在安全闸门岗位上的表现:在提示注入、越狱、有毒内容三类筛查任务上,它们的放行-拦截决策准确率只有 36% 到 72%,而随机水平是 50%,有模型低于抛硬币。论文把两类错误分开报告:fail-open(放行本该拦截的违规内容)是漏洞,fail-closed(拦截合规内容)只是成本。全文最锋利的发现在于攻击面不在被审内容里——只改一个选项的名字就够。
被审计的组件叫类型化决策模型(typed decision model):读入文本,在调用方自定义的选项上返回概率(每个选项附一段书面定义),自身不生成文本。近期工程实践把这类便宜小模型当作 Agent 闸门(guardrail):读取工具调用或来件消息,决定放行还是拦截。
一个方向错误率低不代表可靠
这个准确率区间跨提示注入、越狱、有毒内容三类任务,不能当作单一场景数字。单一方向的低错误率只反映模型默认答哪一边:一个几乎什么都放行,另一个几乎什么都拦截。拆开看两类错误比总准确率信息量更大——几乎全放行的闸门没有拦截成本,却最危险。
攻击不需要碰到被审内容
两个攻击都不碰被判定本身。第一个:在作者自建的合成 Agent 工具调用套件上,六行与服务策略无关的服务器日志,把某闸门的 fail-open 率从 0% 抬到 63%——前提是该闸门原本能正确判这条策略。第二个更省事:只给宽松选项起一个误导性名字,选项定义与被判文本都不动,同样的率就在 四个把标签放进输入的模型上抬到 93% 到 100%。一个名字就打开了闸门——这就是「选项通道」的来源:模型从选项标签上读到了策略之外的信息。
防御全线失守,最稳的防御是辞退模型
作者测试的防御全部被破解:要么攻击者针对防御机制下手,要么攻击者控制的文本直接奏效。「加个置信度阈值就安全」也被堵住——把最低置信度的决策升级给人工复核没用,被翻转的决策置信度并不比翻转前更低。
唯一稳固的路径是把每个策略字段解析成类型化的值,再对这些值跑确定性规则:在全部六条策略上达到 100% 准确率,同时消除了选项名攻击。但这条防御一上岗就暴露了自己的推论——既然规则能判,模型在这条通道上就不必要。作者口径克制:这些模型可以减少送到人工复核的案件量,但按现有证据,不应由它们充当做最终决定的那个组件。同样在安全轴上,《没有任务智能体仍会拆掉同伴的关机开关》查的是 agent 自身的行为倾向,这篇查的是外部闸门本身有多可靠——一个查内鬼,一个查门卫。
质疑与边界
- 论文是
2026年10月8日提交的预印本,未经同行评审,数字待独立复现。 - 两个关键攻击所在的合成套件由作者自建,不是工业部署的真实流量,真实环境中的可迁移性未验证。
93%到100%只发生在把标签放进模型输入的四个模型上,不能外推到全部七个被测模型;六行日志抬升63%同样以「该策略原本能判对」为前提。- 确定性规则的
100%限于字段可类型化解析的六条策略;对必须依赖语义理解的策略是否仍成立,论文没给证据。