可解释性与探针。
2026 年 1 月,Google DeepMind 把激活探针放到了 Gemini 2.5 Flash 的线上流量前面,可解释性从此不再只是一种研究趣味——而真正上线的,是这个领域拿得出手的最不体面的那件东西:一个读取某一层激活值的线性分类器,成本大约是 LLM 分类器的五十分之一,准确率却更高。这就是未来几年里可解释性的实际形状。它读得到任何文本过滤器都看不见的信号,便宜到可以跑在每一个请求上,流量一漂移就崩,而且它需要权重——这意味着对大多数团队来说,它是一个该去问供应商的问题,而不是一个该立项的工程。
探针就是一个视角很好的逻辑回归。
把术语剥掉,机制其实很小。Transformer 让一个向量——残差流——穿过每一层。探针在某一层抽出这个向量,用一个拟合在它之上的分类器去预测输入、或正在生成中的内容的某项属性。在绝大多数已部署的场景里,这个分类器是线性的:一个权重向量加一个阈值,用几千条带标注的样本做逻辑回归拟合出来。
- 训练集就是整个项目。你需要按目标属性标注好的样本——欺骗性与诚实的补全、攻击性网络请求与正常请求、在任务上与被劫持。拟合只要几分钟;收集并标注样本要几周,而它的质量决定了你的上限。
- 选哪一层很要紧,而只选一层是个错误。信号强度随深度剧烈变化,最佳层因属性而异、也因模型而异。多层集成能在任何单层都失效的地方把性能捞回来,所以读几层再组合,而不是去寻找那唯一正确的一层。
- 输出是每个令牌一个分数,不是每个请求一个。模型吐出的每个令牌都对应一个实数激活值,这意味着你可以在生成过程中看着某个信号升高,而不必等一段完整答案出来再分类。这与输出过滤器是真正不同的能力。
- 成本接近于零。每读一层,就是和一个你已经算好的向量做一次点积。这正是这笔经济账能成立的原因——参见模型路由里的级联,同样的形状,只是用在质量而不是安全上。
「探针」与「可解释性」常被混用,而它们不该混。探测问的是这项属性能否从激活值里线性读出,这是一个有基准可测的工程问题。机制可解释性问的是什么样的计算产生了它,这是一个科学问题。前者能上线;后者是那个也许终有一天能让前者值得信任的东西。
为什么它能看见文本分类器看不见的东西。
你今天所有的护栏读的都是表层形式:提示词的字面、答案的字面、检索到的文档的字面。而探针读的是模型在选定任何词之前构建出的那份表示。恰恰在你最在意的那些情形里,这两者会分道扬镳。
- 模型可能知道一件它的输出并没有说出来的事。在简单角色扮演场景上训练的策略性欺骗探针,能泛化到更难的多轮设定,在留出评测集上报告的 AU-ROC 介于 0.96 与 0.999 之间。而读着同一段流畅、自信、错误的文字的文本分类器,手上什么线索都没有。
- 改写撼动不了它多少。表层过滤器会被换词、编码和翻译击穿——那正是标准的注入工具箱。表示层面的信号是更难对付的目标,因为请求要奏效,模型就必须理解它,而探针读的正是这份理解。
- 它触发得早。因为分数是逐令牌存在的,探针可以在生成进行到一半时跳闸,让你在这些令牌抵达渲染器或工具之前中止。对照流式与部分输出——同样是这个生成中途的时机,在那里是问题的来源,在这里是解法。
- 它不是测谎仪,这条警告很重要。探针检测的是训练分布中该属性的某个相关物。若干最知名的欺骗探针结果已被证明依赖的是激活值里携带的文本证据,而非什么享有特权的内部「意图」——所以一个分数漂亮的探针,读的仍可能是一个你并不想要的代理量。
决定能否部署的那个数字,是脆弱性落差。
探针在基准上打出接近天花板的数字,然后在生产里翻车,而且翻得足够规律,以至于这个现象有了名字。分布内表现与分布漂移后表现之间的距离,就是探针脆弱性落差,它不是一个舍入误差。
- 上下文长度就是一种漂移。DeepMind 自己的报告专门点出了这一条:在短上下文样本上训练的探针,用到长上下文流量上会退化。智能体的上下文既长、又在一次运行中不断增长,所以这对智能体部署而言不是边缘情况——这就是常态工况。
- 你的流量永远是与训练集不同的分布。和校准是同一个问题:在别人数据上拟合出的阈值不是你数据上的阈值,而且它滑走的时候没有任何东西会告诉你。
- 一次模型更新会让探针彻底失效。它所读取的那些权重已经不在了。这不是重新校准,这是重新拟合,它该和其他一切会无声损坏的东西一起,进模型弃用与迁移的清单。
- 所以:做级联,别做闸门。已部署的 DeepMind 方案把大约 8% 的流量——探针拿不准的那一段——转给一个完整的 LLM 分类器,最终准确率优于单用 LLM,而推理成本约为后者的五十分之一。探针是一个廉价的分诊层,决定什么值得昂贵的细看。它做唯一权威很糟糕,做第一道过滤器很出色。
成本论证就是全部论证。让 LLM 分类器覆盖 100% 的流量,通常贵到不可行,于是团队开始抽样——而抽样的检测器在设计上就会漏掉攻击。探针覆盖 100%,再让 LLM 只处理探针标出的那 8%,比抽样更便宜,覆盖面严格更好。正是这笔交易让它上了线。
上线的那个,不是出名的那个。
过去几年里,可解释性的公众面孔一直是稀疏自编码器——把激活值分解成一部庞大的、人类可命名的特征词典。那项工作确实有意思,而它不是跑在生产里的东西;在你围绕它做规划之前,值得先弄清这道落差。
- 在下游探测任务上,SAE 一再打不过简单基线。那些做得仔细的案例研究——数据稀缺、类别不平衡、标签噪声、协变量漂移——发现直接在原始激活值上做的普通探针能追平甚至超过 SAE 导出的特征。SAE 确实显出优势的地方是引导:干预一种行为,而不是检测它。
- 没有可对照的真值。没人说得出模型「真正」使用的是哪些概念,所以 SAE 的解释无法被直接验证——只能靠它在某个有分数的任务上是否有帮助来间接验证。这正是这个领域反复要拿随机基线做体检的原因。
- 把这理解为先后次序,而不是否定。今天可部署的那件东西是无趣的那件。把特征词典当成你持续关注的研究计划,把线性探针当成这个季度就能列进预算的控制手段。
只是调用 API,你就跑不了探针。
本页的每一项技术都需要激活值,而激活值在权重后面。这个事实决定了你的团队究竟能做什么,它把世界分成三块。
- 如果你自己部署开放权重,探针今天就对你可用,而它是自托管在价格与隐私之外买到的少数几项真能力之一。把它加进开放权重与封闭模型那本账里——那笔账通常只按成本和许可来算。
- 如果你调用托管的前沿模型,你拿到的是供应商选择去跑的那些探针衍生防护,而且顶多在系统卡里有所描述。你没法为自己的威胁模型、自己的租户、自己对「偏离任务」的定义去拟合一个。问供应商:内部状态监测是否跑在我们的流量上、它的结论我们能否看见——这比多数安全问卷里的问题都更锋利。
- 如果你需要这个但主模型无法自托管,可行的模式是在旁边跑一个小的开放模型,作为被监测的那层表面——也就是小模型与本地模型里的脱敏与分类角色。它探测的是自己的激活值,而不是前沿模型的,所以它只抓得到它看得见的东西,仅此而已。对这个限度要诚实。
别从这里开始。探针是一道很强的第三重控制,也是一道很糟的第一重:如果不可信文本仍然能抵达危险工具,那么一个 AU-ROC 0.99 的检测器就是买错了东西,因为正确的修复是切断那条路径,而不是察觉路径上有流量。先建确定性的控制——范围受限的凭证、出站限制、对有后果动作的审批关卡。然后,若你确实在跑权重、并且手上有一份自己故障的标注语料,就在它上面拟合探针、集成几层、把它部署成级联里廉价的那一层、后面接一个 LLM 裁判,并在每次模型变更时重新拟合。如果你并不跑权重,就把同样的力气花在行为层面的检测上——它读的是轨迹而不是激活值,而且人人都能用。
延伸阅读:思维链忠实性解释了为何推理文本并不是望进那份计算的窗口,护栏说明探针加入的是哪一层,评估护栏与检测器讲的是在信任一个检测器之前如何诚实地衡量它。