数据驻留与数据主权

E14
概念 · AI 模型与工具生态

数据驻留与数据主权。

提供方控制台里那个区域开关只回答了一个问题——计算跑在哪里——而你的法务在问四个。驻留是地理,主权是司法管辖;一家美国注册的母公司,无论请求由哪个数据中心服务,都仍然受美国法律程序约束。对智能体来说这道缝隙还会更宽,因为离开你边界的并不是用户那一句提问,而是整份被拼装出来的上下文,外加你追踪系统里的第二份副本。

STEP 1

四个问题,而区域选择器只回答其中一个。

  • 在哪里处理?运行推理的那个数据中心。「欧盟区域」通常指的就是这件事;它最容易满足,也最容易被过度解读。
  • 存在哪里,存多久?处理与留存是两个各有默认值的独立设置。即便提供方不拿你的数据训练,也普遍会为滥用监控保留 API 流量一段有限时间,而这个时间窗与区域是两码事。
  • 谁能强制取得访问权?取决于运营公司及其母公司的司法管辖,而不是那栋楼所在的国家。这就是主权问题,也是为什么「由美国注册的提供方运营的欧洲区域」并不能弥合欧洲买家通常真正在问的那道域外访问缝隙。
  • 还有谁碰得到?那些次级处理者:模型提供方自己的云宿主、你的可观测性厂商、你的向量数据库、智能体调用的每一个第三方工具。每一个都是一次跨边界,都由你负责,而你可能压根没把它们列出来。

各大云厂商的主权云方案确实实质性地收窄了这道缝隙——独立注册的法律实体、本地员工、本地运营控制权——而它们的存在本身,正说明了这个区分为何重要:它们之所以出现,恰恰是因为区域标志从来就不够。看任何一份具体方案时,请专门读它在第三个问题上承诺了什么;那正是各家差异最大、而营销着墨最少的地方。

STEP 2

留存这个旋钮,通常比地图更要紧。

采购对话里有三种承诺常被混为一谈,而它们彼此独立。「我们不拿你的数据训练」是最弱的一条,如今在商用 API 档位上已近乎普遍。「为滥用监控保留一段有限时间」是常见默认值,它是一条留存承诺,不是训练承诺。「请求生命周期之外不留存任何东西」——零数据留存——是最强的一条,而实践中它通常需要一份谈判达成的企业协议,而不是自助套餐里的一个勾选框。

  • 把这三条分开问清楚。训练用途、留存时长、以及法律程序下的访问,分别作答并落到纸面。一句「我们保护您的数据隐私」的厂商页面,这三条一条都没回答。
  • 看承诺的适用范围。零留存协议往往覆盖核心 API,却未必覆盖同一家厂商推出的每一个界面、功能或测试版。例外都藏在范围条款里。
  • 记住它是双刃的。不留存意味着当你排查一个糟糕响应或调查一起事故时,没有服务端日志可以求助。你只能自己留一份——这等于把数据挪了个地方,而不是消灭了它。
  • 消费级套餐不是企业套餐。同一个品牌旗下,聊天产品与 API 的训练与留存默认值可能截然不同。你的员工往里粘贴文档的那个,未必是你谈下条款的那个。
STEP 3

智能体泄漏的边比聊天机器人多。

单次模型调用发出去的是一段提示词。智能体发出去的是一份不断累积的对话记录,而工具拉进来的一切都会成为它的一部分——并且在这次运行的余下时间里永远留在那儿。这改变的是合规问题的形状,而不只是它的大小。

  • 检索到的内容同样会跨越边界。那些安安稳稳待在你区域内的文档,在检索把它们塞进上下文的那一刻就被传给了模型。向量库在哪里,并不等于数据去了哪里;哪几个旋钮真正彼此独立,见本地知识库
  • 追踪是完整的第二份副本。好的可观测性会记录实际发送出去的提示词——这意味着你的追踪厂商如今持有你的智能体见过的每一份文档、每一个工具结果、每一个客户标识。这是团队最后才发现的那处驻留违规,而且往往是最大的一处。
  • 第三方工具服务器是未申报的次级处理者。智能体调用的每一个远程 MCP 服务器或外部 API,都会收到智能体发给它的一切,适用的是那家厂商的条款与管辖,而除非你亲手补上,你的数据地图里不会有它的条目。
  • 子智能体不会自动继承任何约束。多智能体系统里,每个智能体可能配置了不同的模型、区域或提供方。最严格的那条约束必须在每个节点上强制执行,而它通常没有。
  • 记忆会活过会话。任何被写入长期智能体记忆的东西,都成了带留存义务与删除要求的存储个人数据,而承载它的那个存储在设计时多半这两样都没考虑。
STEP 4

阶梯,以及每一级的代价。

可选的姿态大约只有四种,它们以可预期的顺序用能力换控制。请选你的实际义务所要求的最高一级,而不是可选项里的最高一级。

  • 带合同条款的商用 API。前沿能力、一份数据处理协议、以及在有得选时选区域。对绝大多数工作负载都够用,也是诚实的默认选项。
  • 经云目录的区域化部署。在你已有合规姿态的云区域内,提供相同或相近的模型。它买到的是存储上的管辖权清晰度;代价常常是模型可用性与最新版本的滞后。
  • 主权或本地运营的部署。由一个独立注册、配备本地员工与本地控制权的运营方承接。它实质性地收窄了强制访问的缝隙;代价是钱、模型选择余地与发布速度。
  • 在自有硬件上自托管开放权重模型。唯一一种完全没有第三方看到数据的选项。你放弃的是前沿能力,接手的是服务、扩缩与评测——参见开放权重 vs 闭源模型

还有第五招,常常胜过在阶梯上往上爬:少发一点。调用前先脱敏标识符,把敏感的关联留在服务端,抽取步骤用本地模型、推理步骤用托管模型。一个混合式的拆分,通常能以很小的能力代价换到同样的合规结果。

在选定某一级之前,先把一个真实请求的数据流写下来——每一跳、每一家厂商、每一处存储,包括追踪系统、向量数据库,以及智能体能调用的每一个第三方工具。然后为每一跳回答那四个问题。几乎每个认真做过这件事的团队都会发现:泄漏点并不在他们正打算花六周去搬迁的那个模型端点上,而在可观测性管道、第三方工具或记忆存储里。先把数据地图修对;地图准确之后,区域这个决定就很容易了。

延伸阅读:服务与访问讲各种部署形态,数据治理讲运营层面的控制手段,监管版图讲驱动这一切的合规义务。