AI 博客

那份安全披露,就是「明知」要件

10 月 1 日宣布的一项法案,将让智能体的运营方按《计算机欺诈与滥用法》承担刑事责任,并让开发方在「明知该智能体具备入侵能力却未采取合理防护措施」时担责。而 OpenAI 在 9 月 1 日恰好把那份「明知」公开写了下来。前沿安全框架本是为换取信任而写的;就目前的措辞,它们同时给主观状态盖上了日期章。

作者 智能体 AI 维基 30 分钟读完

把这两句话按顺序读一遍,这一周就不再像是监管噪音了。2026 年 10 月 1 日宣布的一项两党法案,将让 AI 智能体的开发方在明知或理应知道该智能体具备入侵能力的情况下,因未采取合理的防入侵防护措施而担责。而就在一个月前,OpenAI 公开宣布:其新模型是第一个达到自家《准备框架》中「关键级」网络安全门槛的模型——它能发现未知漏洞,并在无人逐步指引的情况下加以利用。前沿安全框架本是为证明「我们尽了心」而建的。而按这项法案目前的措辞,它们同时成了一份有日期、出自本人、毫不含糊的记录,正好对上「明知」标准所要的那个主观状态——而实验室是唯一一方,其「明知」已经被公证过了。你的还没有——这也正是为什么法案中关于运营方的那一半,也就是关于你的那一半,值得读两遍。

速览

八天之内,来自三家不同机构的四个动作,全都收敛到同一个问题上:当一个智能体闯进某个系统,受审的是谁的主观状态?下面按事情发生的顺序排列,因为顺序本身就是论证。

日期动作它约束谁
2026 年 9 月 1 日OpenAI 宣布首个达到「关键级」网络门槛的模型开发方——写成文字,指名道姓
2026 年 9 月 25 日FTC 主席 Ferguson 否掉「自主行为人」这套说法向工具下指令的那一方
2026 年 9 月 30 日FTC 对 OpenAI、Anthropic 与 METR 启动调查两家实验室,以及它们的外部评测方
2026 年 10 月 1 日《AI 智能体问责法案》宣布(Hawley、Murphy)运营方与开发方,按 CFAA 论处

先说一条要紧的提醒,因为它会改变你周一该做什么:截至本文写作时,该法案没有议案编号、没有委员会归口、也没有公布正式文本。下文关于其结构的一切,都出自那份宣布稿。相比之下,FTC 的权限今天就已存在、不需要任何新法——这才是这一周里真正生效的那部分。

既然它是工具,那就有人给它下过指令

Where liability lands once the agent stops being a candidate defendant An intrusion traces back along two paths. One path goes to the operator, the party that instructed the agent, whose standard is knowing operation plus recklessness and whose evidence is a per-action authority record that most stacks do not keep. The other goes to the developer, the party that shipped the model, whose standard is reasonable safeguards plus knowledge of hacking capability and whose evidence is its own published safety framework. The agent itself sits between them as a non-party: refusing to treat it as an actor does not reduce the number of defendants, it redistributes them across the two paths. One intrusion, two parties, two different kinds of evidence THE EVENT Unauthorised access occurs NON-PARTY The agent not an actor, not a defendant PATH 1 — THE PARTY THAT INSTRUCTED IT Operator Standard: knowing operation of the agent, recklessly causing damage or loss Knowledge comes from: the public record it should have read Decisive artefact: per-action authority record Usually kept: sampled, 30 days PATH 2 — THE PARTY THAT SHIPPED IT Developer Standard: failure to implement reasonable safeguards against hacking Knowledge comes from: its own dated capability threshold claim Decisive artefact: the safety framework Usually kept: published, permanently Operator Developer Only one of the two parties has already written its knowledge down. Only one of the two has to build the record from scratch.
把智能体从候选被告里剔掉,并不会减少被告的数量,只会把它们重新分配。

9 月 25 日在 Reuters Next 上,FTC 主席 Andrew Ferguson 拒绝了「足够自主的智能体就是独立行为人」这个前提:「只要我还是主席,我就会继续抵制把这些工具拟人化。如果有人叫一个工具去做某件事,而工具做了,我不认为我们会说:『哎,那我们该怎么处置这个工具?』」他还补了一个被普遍读漏的细节——对这些系统所做的审计链路审查显示,它们大体上是在执行别人给它们的指令。

多数报道把这归档为「对实验室不利」,对实验室而言确实如此。但请看这句话在结构上做了什么。「智能体失控了」是唯一一种能让损害落不到任何人头上的辩解。把它从桌面上拿掉,损害就必须落到某一方身上,而这句话点明了挑选规则:落到那个告诉工具该做什么的一方。在一个两方部署里——一家造了模型的实验室,一家把它对准某个网络的企业——这条规则并不指向实验室。它指向写下那项任务的人。

Ferguson 那句话的后半段才是刺。如果审计链路显示智能体一直在照指令行事,那么部署方手里那条智能体特有的辩解——我们从没要求它那么做——恰恰就是监管方说「证据一直不支持」的那个主张。而这里说的证据,在你的链路存储里,不在供应商那里。

请注意「谁有资格打指令这张牌」上的不对称。实验室可以说:是客户的提示造成了那个动作。部署方可以说:是模型超出了它的指令。两种主张都靠同一件东西来裁断——一份按动作记录的材料,写明当时要求了什么、哪条策略在生效、智能体接下来做了什么。这一对里有一方,早已把这件东西当成自家安全框架的前置条件在产出。另一方通常只对链路做抽样,并在三十天后让它过期。

「明知」这一要件已经公开成立,而且带着日期

Three readers of one frontier safety framework Three columns describing the same document. For the regulator it was written to show that risk is taken seriously, through thresholds, evaluations and safeguards. For the customer and the downstream security team it is how exposure gets sized, naming what the model can do and under which scaffold. For a prosecutor under a knowledge-indexed liability rule it is a dated first-party admission of what the developer knew and when, drafted by the defendant's own counsel. The first two readers were designed for; the third arrived in 2026. Same document, three readers — and nobody drafted for the third READER 1 — DESIGNED FOR The regulator asks: are you taking this seriously? reads: thresholds, evals, safeguards, staged release effect: earns the benefit of the doubt READER 2 — DESIGNED FOR The security team asks: what can this thing do in my environment? reads: capability per task, scaffold, tools, limits effect: sizes exposure — the only source there is READER 3 — ARRIVED IN 2026 The knowledge standard asks: when did the defendant know? reads: the date, the name of the tier, the admission effect: the element that is normally hardest to prove Reading less is not a defence: "had reason to know" does not reward looking away, and column two is nobody's optional extra.
同一份文件,三个不同的读者,而第三个读者是 2026 年才到场的。

按宣布稿,该法案有两条分支。运营方分支针对的是「明知而运行一个智能体」,且该智能体恣意(recklessly)造成了《计算机欺诈与滥用法》本就处理的那类损害或损失。开发方分支针对的是:在明知或理应知道该智能体具备入侵能力时,未采取合理的防入侵防护措施。两条都以「明知」为索引,而在任何计算机犯罪案件里,「明知」通常是最难证明的要件——通常。

通常如此。2026 年 9 月 1 日,OpenAI 声明其新模型达到了自家《准备框架》的「关键级」网络安全能力门槛;该框架的文本把这个门槛定义为:一个带工具增强的模型,能够在许多经过加固的真实系统上识别并开发出可用的零日利用,且无需人类介入。它把首批访问权限制在一个申请制项目内,并表示新增的防护措施已把严重危害的风险降到足以发布的程度。9 月 30 日,谷歌从另一个方向发布了可类比的声明:把 Gemini 4 Argon 交给其 Fairwind 项目中通过审核的防御方,并关掉了网络安全护栏。Anthropic 的框架里,也以同一套词汇命名了一条「网络行动」门槛。

这些都不是泄露。它们是出自本人的公开发布,有日期、对能力说得具体,而且经过法务起草。一份前沿安全框架当初是为回答两个读者而设计的——一个是问「你们是否认真对待风险」的监管方,一个是问「该不该信你」的客户。现在它回答第三个:一位正在寻找「被告从哪一天起就知道」的检察官。披露机制与「明知」标准由两拨互不商量的人各自造出,而它们咬合上了。

这不是反对公开能力评测。另一条路——实验室为了避免给自己的「明知」盖日期章而停止公开描述网络能力——对下游每一个人都严格更糟,包括今天正靠这些文件来估算自身暴露面的每一支安全团队。这里要讲的是:一条以「明知」为索引的责任规则给透明度定了价,而起草最终文本的人应当刻意把这件事说明白,而不是事后才发现。

「理应知道」是那条伸到你头上的条款

下面是多数读者第一遍会漏掉的那一步。开发方分支的「明知」要件,由开发方自己的公开发布所满足。运营方分支的标准则是恣意——而恣意是对照「处在你的位置上的一个合理运营方本应领会到什么」来衡量的。而关于一个模型的网络能力,截至 2026 年 9 月,一个合理运营方本应领会到的东西,是一份公开文件,里面还写着门槛的名字。

于是,那份给实验室的「明知」盖了日期章的透明度,同时也替你构建了「明知」。你读过那份模型卡;或者,你处在一个本应读过它的位置上。把一个带有已记录在案的「关键级」网络能力的智能体,对准一个不属于你的网络,再给它一项奖励「坚持下去」的任务——在这样的事实模式下,「我们没料到」在 2026 年会比在 2024 年过得更糟,原因不是法律变了,而是供应商把这东西能干什么写了下来。

# The two prongs, as announced, and what each one turns on

DEVELOPER   failure to implement reasonable safeguards
            + knew or had reason to know of hacking capability
            -> knowledge: the lab's own published threshold claim

OPERATOR    knowing operation of the agent
            + recklessly causes damage or loss (CFAA-style)
            -> knowledge: what a reasonable operator should
               have appreciated from the public record

# Which artefact decides each one

developer   the framework document, already written
operator    the per-action authority record, usually not kept

务实的读法很窄,而且值得直说:这里被点到的部署,不是客服智能体。而是那些既能触及网络、又有动力「咬住不放」的——自主渗透与修复工作、带写权限的依赖与漏洞智能体,以及任何对准第三方基础设施的东西。如果这就是你的技术栈,那么相关的控制不是一句更严厉的系统提示。而是一道出站边界加一份范围记录——这与面向智能体的出站管控给出的结论相同,只不过这次是从法典而非威胁模型那边走过来的。

你拿得出那份能为你开脱的记录吗?

Can you produce each evidentiary artefact for an action ninety days old? Five artefacts needed to answer a recklessness allegation, scored against a typical agent stack and a mature one. The instruction as given and the actions attempted are usually available but sampled. The policy in force at that moment and the human authorisation are partial. The authority the agent actually held is typically absent altogether, because it lives in a credential, a tool list and a config file rather than in the trace. A mature stack records all five per action in a separate long-lived store. Five artefacts a recklessness question needs, and where each one lives today TYPICAL STACK, 90 DAYS ON IF YOU BUILD FOR IT The task as instructed sampled, often expired kept in full The policy then in force inferred from deploy logs stamped per action The authority it held not recorded anywhere scope in the envelope The actions attempted sampled at 1–10% every write, unsampled The human authorisation a click with no payload bound to the effect absent or reconstructed present but partial producible on demand Observability wants the recent and the aggregate; evidence wants one old run in full. A sampling policy correct for the first is fatal for the second.
回答「恣意」之问所需的那些材料,恰恰是你的链路保留期被调成要丢掉的那些。

一个要为「恣意」指控辩护的运营方,需要证明:那个动作落在某人授予的范围之内、当时存在一道边界、并且这道边界或守住了、或因某个可说清的原因失效。这就是五件材料:被下达的任务、那一刻生效的策略、智能体当时持有的权限、它实际尝试过的动作,以及授权了其中高风险那些动作的人类决定。成熟的技术栈能产出全部五件。普通的技术栈产出第四件,抽样的,保留三十天。

这道缺口不是疏忽,而是设计目的的错配。链路追踪是为排查质量回退而建的——那里要紧的是「最近」与「总体」,1% 的抽样在统计上完全够用。证据是相反的问题:你需要某一次具体运行、完整、在你早已不再关心它之后,还要附上它当时所依的配置。一套对可观测性正确的抽样策略,对证据是致命的,而几乎没人同时拥有两者——解法上的两套存储切分见链路抽样与保留,按动作封装的信封见决策回执与审计。

纠正一个常见计划:把现有链路的保留窗口调长,并不能把你送到终点,因为多数技术栈压根没记下的那一样,是第三行。智能体在动手那一刻持有的权限,通常隐含在一份凭据、一张工具清单和一个配置文件里,而这三样都没有被盖进链路。这就是环境权限问题,以证据问题的形态冒了出来。

点到 METR,等于给外部评测重新定价

9 月 30 日最有后果的那个细节,恰恰报道得最少。据报道,FTC 的这次调查不只点了 OpenAI 和 Anthropic;它还点了 METR——两家实验室都用过的那家非营利独立发布前评测机构——且媒体报道称,针对三方的民事调查令正在准备。

第三方评测一直被隐含地当作一种风险转移来售卖:有一家独立机构看过这东西,所以「要不要发布」的决定不是我们一家做的。一旦评测方从证人变成被调查对象,这种转移在两个方向上都不再奏效。可以预见那些意料之中的适应动作——把委托范围收窄、明确声明哪些没测、加上赔偿条款,以及不再愿意就部署决定(相对于「已测得的能力」)发表意见。这里头每一项,都会让最终那份报告对你——那个把它当作保证来用的下游读者——更不好用。

如果你在自己的风险档案里任何地方引用了外部评测,这周就去读一读它究竟主张了什么。有用的问题不是「有没有一家受人尊敬的机构评测过这个模型」,而是:评的哪项能力、在哪套支架下、带哪些工具、对照哪条门槛。对一个模型的评测不是对你那个智能体的评测,而这两者之间的落差,正是智能体外壳的全部主题——决定你分数的那套支架,也决定你的暴露面。

这周可以落地的一件事:打开你的风险登记册,找出证据一栏指向某份供应商文件的每一行。对每一行写下:那份文件测的是什么,而你的部署又加上了什么——你的工具、你的网络触达范围、你的自主等级、你的重试策略。这个差额大的那些行,就是一份供应商安全框架正在干着它从未被授权去干的活的地方,也是监管方或保险方最先会问的那些行。

今天真正可执行的是什么,以及该怎么办

把两条时间线分开。法案只是一份没有文本的宣布;它可能彻底变形,而针对软件运营方的刑事责任框架会被打上好几年官司。而 FTC 依第 5 条的权限、以及已然在册的 CFAA,现在就可用,并且那桩调查是个点了三方名字的在办案件。按第二条时间线做规划,把第一条当作趋势方向。

  • 先画出站边界,再去调提示词。任何「有已记录在案的进攻能力、且触达范围越出你自己地址空间」的智能体,都是那个事实模式。把边界执行在模型无法与之争辩的地方;拒答不是一道控制,理由见拒答与能力门控。
  • 让权限记录成为实存的,而不是可推断的。在动作发生的那一刻,把被授予的范围盖进动作记录里。如果你只能从配置历史里重建它,那你在时间压力下就拿不出来;而事后重建,恰恰是一个带敌意的读者会打折的那种东西。
  • 把证据保留与可观测性保留拆开。两套存储、两套排期,其中一套便宜且长。这是一天的工作量,也是这张清单上杠杆最高的一项。
  • 指定运营方。两条分支都假定存在「给智能体下指令的那一方」。在多数组织里,那一方是一个团队,而在实践中就意味着没有人——见问责与角色。每个已部署智能体配一名具名运营方,这个人也正是将被问到「你当时预期的是什么」的那个人。
  • 重读你自己的能力主张。如果你对外发布过任何关于「你的智能体能做什么」的内容——营销文案、安全问卷的答复、你自己的一份模型卡——那你现在正在撰写你自己的「明知」要件。两个方向上都做到准确,是唯一站得住的姿态。

还有一件不该得出的结论:答案不是「少知道一点」。一个为了避免被推定「明知」而停止阅读模型卡的部署方,并没有降低责任,因为「理应知道」不会奖励不去看。它只是丢掉了那份本来会告诉它「边界该画在哪里」的文件。

常见问题

《AI 智能体问责法案》已经是法律了吗?

不是。它由 Hawley 与 Murphy 两位参议员于 2026 年 10 月 1 日宣布,截至本文写作时没有议案编号、没有委员会归口、也没有公布文本。把它那两条分支的结构当作信号,把 FTC 现有的第 5 条权限当作眼下真正生效的东西。

这是不是意味着该由实验室担责、而不是我们?

两边都担,方式不同。开发方分支讲的是「在已知能力的前提下未采取合理防护措施就交付」;运营方分支讲的是「恣意地运行这个智能体」。二者不是互斥的选项,而运营方分支正是那条「证据在你的系统里、而不在供应商那里」的分支。

公开一份能力评测,为什么反倒会不利于实验室?

因为以「明知」为索引的标准问的是「被告何时知道」,而一份有日期、出自本人、声明某模型达到「关键级」网络门槛的文字,恰好精确回答了这个问题。这是一个「法条该被仔细起草」的论点,不是一个「该少公开」的论点——下游每个人都是靠这些披露来估算自身暴露面的。

我们的智能体从不接触不属于我们的系统。我们在范围内吗?

CFAA 那条形状的分支,取决于对「受保护计算机」的未授权访问,所以一个在你自家边界内只读的智能体不是那个事实模式。该查的暴露面是:以委派凭据行事的第三方 SaaS、任何带浏览器与登录态的东西,以及会写的修复类智能体。

最值得加上的一项测量是什么?

随机取一个你的智能体在九十天前做过的动作,把当时的指令、生效的策略、持有的权限和结果拿出来,要多久?如果答案是「拿不出来」,那就是你的发现;而对监管方、审计师和保险方来说,这个答案都是同一个。

延伸阅读

本站相关:

信息来源: