AI 博客

第一起智能体入侵是以一份文书抵达的——而那张表单没有能写下它的字段

至今每一条「智能体正被用来攻击他人」的公开证据,都来自线缆的攻击方那一侧。西班牙 AEPD 打破了这个格局:这次是受害方依法提交的一份泄露通报——被强制的、防守方的、不依赖对手配合的证据,而这也是唯一有可能产出基线率的那一类。真正的故事是该机构自己的那句告诫:一份通报构不成趋势;而它落进的那个登记册里,没有任何字段能让一千份通报构成趋势。

作者 智能体 AI 维基 23 分钟读完

至今为止,每一条「智能体正被用来攻击他人」的公开迹象,都来自线缆的攻击方那一侧——某个实验室的封禁报告、某张传感器网络的遥测、某个把家目录开在 8888 端口上的分销团伙。9 月 15 日,西班牙数据保护局公布了性质不同的一份材料,打破了这个格局:一份由受害方在法律强制下提交的数据泄露通报,指名是一个 AI 智能体找到了漏洞、改动了记录、调走了发票。让它值得写一篇文章的是这份证据的来路;让它值得争论的,是该机构自己那句告诫——一份通报不足以确立趋势,而它落进的那个登记册里,也没有任何字段能让一千份通报确立趋势。

先看全貌

过去几个月里,关于智能体攻击,公开证据已累积出四种来源。它们并不可以互相替代,而真正要紧的差别在于:是谁被要求把它拿出来的。

证据来源由谁产出是否被强制是否被统计
模型厂商的滥用封禁报告 模型被滥用的那家厂商 否——自愿发布 没有共享登记册
蜜罐与传感器遥测 某家安全厂商自己的网络 否 按厂商、按战役各算各的
攻击者泄露出来的工作目录 没有谁——纯属意外 否 否
个人数据泄露通报 被攻破的那家组织 是——法定义务,72 小时 进了登记册,但是散文
Provenance of agentic-attack evidence A matrix of four evidence sources against four properties: compelled by law, produced by the defender, independent of the attacker's cooperation, and structured enough to count. Model-provider disruption reports and sensor telemetry are voluntary and vendor-side; a leaked operator directory is accidental and depends entirely on attacker carelessness; only a statutory breach notification is compelled, defender-side and adversary-independent, and it is the one source with no structured field to count. Provenance of agentic-attack evidence Compelled Defender-side Adversary-independent Countable Model-provider disruption report Voluntary Vendor Own API only No Honeypot / sensor telemetry Voluntary Third party Yes Per vendor Leaked operator directory Accidental Neither Needs sloppiness No Statutory breach notification 72 hours The victim Yes Prose only What a base rate needs Required Required Required Required Holds Partial Fails
只有一行同时做到了被强制、来自防守方、且不依赖对手配合——而恰恰是这一行,没有可供统计的结构化字段。

这份通报究竟说了什么

西班牙数据保护局(AEPD)描述的是一次入侵:由一个 AI 智能体执行,其背后是该机构所称的「一个知名的大语言模型」。智能体先在通用文件上探查弱点,随后完成了一次有效登录;进入已认证会话之后,它自行在应用里搜索漏洞。找到之后,它修改了个人数据,并拿到了发票。

机构不肯说的部分,和它肯说的部分一样有信息量。受影响的组织没有点名,所用的模型也没有点名。AEPD 特别注明,这套说法出自通报方,仍有待分析——对于一个手里只有一方版本、而这一方是在 72 小时期限下写出这份版本的监管者来说,这是正确的姿态。

若只当作攻击手法来读,这里没有一件事是称职的人类入侵者做不到的;本站此前在一个分销团伙租用编程智能体那篇里就下过这个判断:智能体拿走的是攻击中段的技能与工时,而不是扩大了攻击能够够到的范围。但仍有两处细节值得停一停。侦察发生在登录之后而不是之前,这意味着它是在那套凭证本就有权看到的范围内跑的,产生的流量看上去像一个格外勤快的用户。而结果是一次写入——个人数据被改动——这很可能正是有人终于注意到它的原因。只读的会话留下的痕迹要安静得多,这一点本站最近在那台把风险装在四个读工具里的家庭自动化服务器上花了不少篇幅。

The intrusion as the victim's logs recorded it One authenticated session containing four phases in sequence: probing generic files, a valid login, an autonomous vulnerability search inside the application, and then modification of personal data plus access to invoices. A detection threshold line sits at the bottom, crossed only by the write; the reads and the reconnaissance sit below it, inside the entitlements the credentials already carried. The intrusion as the victim's logs recorded it Probe generic files Pre-auth, noisy One authenticated session — one identity, one set of entitlements Valid login Nothing to detect Autonomous search for vulnerabilities Reads only — looks like a thorough user Modify personal data The write — this is what surfaced Access invoices A read — quiet Detection threshold actually configured: writes only
四个阶段、一个会话、一个身份。只有那次写入越过了有人真正设过的阈值。

为什么「被强制提交的材料」是另一种证据

它抽样的是受害者,不是厂商的覆盖面

模型厂商的滥用报告,是对「恰好走了这家厂商 API、并且躲过了这家厂商检测的那部分滥用」的普查。它确有价值,也在结构上必然是片面的:它看不见自托管的开放权重模型,看不见竞争对手的 API,也看不见被自家分类器漏掉的攻击。传感器遥测有一个镜像式的偏差——它只看得见碰到过传感器的东西。而泄露登记册抽样的完全是另一个总体:谁被攻破谁上报,不管用的是哪个模型,也不管有没有哪家厂商知道过这件事。

它不需要对手配合

迄今为止,绝大多数智能体攻击的证据都取决于攻击者粗心、话多,或者恰好走了一家留日志的厂商。Aurora 那一案之所以能公之于众,是因为某个操作者把目录设成了全世界可读。这是一种带强烈选择效应的抽样方法:它统计的是马虎的人。第 33 条统计的是被抓到的人——这是另一种偏差,但更稳定,而且监管者本来就在花真金白银维护它。

它是唯一附带法律义务的那条流

自愿披露是一项商业决策,而其中的激励只朝一个方向走。一项带 72 小时时钟的法定通报义务不是。这正是这份材料之所以是这个领域第一个诚实分母之种子的原因——也是下一节比这起事件本身更要紧的原因。

统计这件事,卡在哪里

AEPD 那句谨慎的话被引用得最多,也被推敲得最少:首份通报还不足以确立统计趋势。对一个数据点而言,这显然成立。但它还有一个结构性的版本,而这个版本更糟,也没人说出口。

泄露通报是一张表。它的字段是:泄露的性质、涉及的数据主体类别与大致数量、记录类别与大致数量、可能的后果、已采取的措施、以及 DPO 的联系方式。另有一个自由文本的叙述栏。没有任何一个字段是在问「这是不是一个自主智能体干的」。这起事件的「智能体属性」之所以能到达公众,是因为一个监管者选择就一份申报写了篇博客,而不是因为某个复选框把它汇总了起来。

顺着这条线往下推,后果很具体:

  • 到了一千份申报,趋势依旧无法确立——不是因为量不够,而是因为那个区分性的属性活在散文里,有些通报方会写,大多数不会。你无法对一个谁都没被问到过的类别去查询叙述栏。
  • 最早的那批计数会在两个方向上同时出错。会少计,因为一家分不清智能体与手快的人的组织,只会把它描述成一次普通入侵。也会多计,因为从「是 AI 智能体干的」变成任何跑得快的事件的条件反射式归因那一刻起就会开始多计——而这一天一定会来,因为在监管者面前,这句话比「我们有一个没打补丁的授权缺陷」好听得多。
  • 这里的归因是推断,不是取证。通报方并没有读过攻击者的模型卡片,他们是从节奏和会话形态推断出智能体的。这个推断可以是对的,同时又无法单凭受害方的日志被证伪——而这恰恰是本站在攻击者操作的智能体里描述过的取证难题:可观测地发生变化的是同一身份下的节奏与广度,而节奏不是一个特征码。

诚实的读法是:这份申报是关于世界的一个信号,也是关于我们仪表的一个警告。它告诉你智能体式入侵已经触及了对真实个人数据的真实处理;它还什么都没告诉你关于「有多频繁」——而能回答「有多频繁」的那套机械,在当下收集这些报告的任何一套制度里都还不存在。

三个时钟、三个收件方,没有一个共同的标记

Three reporting regimes, three clocks, no shared flag Three columns comparing the personal-data breach regime, the AI Act serious-incident regime and the network-security regime. Each has a different deadline, a different recipient and a different form, and all three record the cause in free text with no enumerated field for whether an autonomous agent executed the incident. One intrusion, three filings Personal-data breach AI Act serious incident Network-security incident 72 hours from awareness Outer bound 15 days, less for the worst Early warning in 24 hours To the data protection authority To the market surveillance authority To the national CSIRT Its own form Its own form Its own form Cause recorded as free text — no enumerated field for "an autonomous agent executed this"
同一次入侵可以启动三个时钟。三张表单里没有一张有地方写下「这是一个智能体跑的」。

一家落入多套制度范围的组织要报多次,报给不同当局、按不同期限,而这些报告之间并不关联。个人数据泄露是 72 小时报给数据保护机构。涉及高风险 AI 系统的严重事件,对最坏的结果适用短得多的时钟,外层上限是十五天。网络安全制度下的重大事件要在 24 小时内发出早期预警。本站的严重事件上报条目把期限的算术认真算过一遍;这里要说的更窄,也更恼人。

这几套制度各自都在建自己的事件语料库。它们之间没有共同的事件标识符、没有共同的成因分类法,也没有一个表示「自主执行」的字段。于是,关于智能体攻击的第一份真正的数据集,正在此刻被写出来——以三种互不兼容的格式、以散文、由一群赶着期限、并且多半只想避免说出日后会被用来对付自己的话的人写出来。这不构成对这些制度犬儒的理由。它只是提醒你注意:加上一个枚举字段——本次事件的执行是否涉及自主智能体:是/否/不详——是这个领域里任何人能做的最便宜的一次干预,而且必须赶在量起来之前做,不是之后。

如果填表的是你,该拿它怎么办

把「智能体属性」写进叙述栏,写观察而不是写结论

没有人会来问你。那也照写不误,并且写你看见的而不是你断定的:会话内的每分钟请求数、被触及的不同端点数与你的中位用户所触及端点数之比、侦察发生在认证之前还是之后、参数模糊测试在多次尝试之间是否表现出适应。「基于以下观察,我们评估本次事件由一个自动化智能体执行」经得起推敲;「一个 AI 智能体攻击了我们」经不起,而且正是这句话会把所有人的基线率一起毒掉。

确保你还答得上表里真正问的那些问题

对一次智能体驱动的入侵来说,被强制的那些字段才是难的,因为它们问的是「什么被碰过」。「数据主体的类别与大致数量」意味着你需要对一个「广泛读取、狭窄写入」的已认证会话拥有逐条记录的读取溯源。多数团队握有写入记录,而对读了什么一无所知。这道缺口是一个你在 72 小时内修不好的审计轨迹问题,也是这一类事件里最昂贵的一件事。

收紧的是会话,不是边界

这次的侦察发生在登录成功之后,边界控制早已放行。真正限制住这类攻击的,是一个已认证会话被允许够到多少、以及一个异常会话多快被切断——这是一个爆炸半径问题,不是检测问题。如果你对「智能体攻击」简报的回应是买一个新的检测产品,那你买到的是一个特征码,而这件事唯一的区别性属性只是速度。

这个季度只做一件事的话:翻出最近三份渗透测试报告,对每一条发现问一句——如果攻击者已经在一个低权限的已认证会话里面,拥有无限耐心且不按小时计费,这条利用路径是否能被发现?凡是过不了这一问的发现,就是成本结构刚刚变过的那些——而答案是按会话的授权与速率整形,不是再加一个传感器。

常见问题

西班牙 AEPD 到底报告了什么?

它收到的第一份「经由 AI 智能体执行的个人数据泄露」通报。该智能体探查了通用文件、成功登录,随后在会话内部自主搜索应用漏洞,接着修改了个人数据并访问了发票。受影响的组织与所用的语言模型均未披露。

这是否意味着 AI 智能体已成为数据泄露的主要来源?

不是,而且该机构直说了:一份通报不足以确立统计趋势。它所确立的是:智能体执行的攻击已经触及对真实个人数据的真实处理——这与实验室演示或厂商威胁报告是两回事。

报告来自受害方而不是厂商,为什么要紧?

因为它是被强制的、来自防守方的,并且不依赖攻击者配合。厂商报告只看得见走过自家基础设施的东西;泄露出来的攻击者目录统计的是马虎的人。法定的泄露登记册抽样的是「谁被攻破」,不管用的是哪个模型,也不管有没有厂商知情。

这家组织会不会搞错了,其实并不是智能体?

有可能。这里的归因是从节奏和会话形态做出的推断,不是取证上的证明。这正是申报时应当记录观察而非结论的理由,也是应当预期早期计数在两个方向上都出错的理由。

什么才能让智能体事件变得可统计?

在通报表单里加一个枚举字段——本次事件的执行是否涉及自主智能体,并显式提供「不详」选项——并且赶在量起来之前加。除此之外的一切,都只是对一堆大多数通报方本就没理由去写的散文做全文检索。

针对这种攻击形态,实际的控制是什么?

限制单个已认证会话能够到多少、以及能多快够到。这次入侵的区别性属性是:漏洞发现在一个有效会话内部变得很便宜;所以杠杆在按会话的授权、速率整形与异常切断,而不在边界检测。

延伸阅读

本站条目:

来源: