深度剖析 / 智能体安全

智能体安全

端到端保护一台生产级智能体——注入防御、策略即代码、身份与鉴证、红队、隔离,以及 2026 年落地的审计原语。

  1. 2026 年的提示注入防御
    提示注入是尚未解决的前沿问题,不是能打补丁的 bug——指令层级、纵深防御分层,以及 Gemini CLI CVSS-10 事件为何证明单模型防御会失败。
  2. 面向智能体的策略即代码
    用 OPA/Rego 与 Cedar 在边界处对每次工具调用做门控——PDP 放在哪里、失败放行还是失败拦截,以及让拒绝可被机器读取的结构化 PolicyDecision。
  3. 智能体身份与鉴证
    三个互补的层回答"是哪个智能体在调用我"——签名的 Agent Card、运行时鉴证(OATR)、以及可验证凭证——外加 Visa 用于商务的 RFC 9421 请求签名。
  4. 对智能体做红队
    MCPTox 显示 20 个模型平均攻击成功率 36.5%——且存在逆向扩展,越强的模型越易受攻击——以及一套可变成可重复测试台的三范式方法论。
  5. 沙箱与隔离模式
    对智能体生成的代码而言,共享内核的容器已经不够了——2026 年的层级是 microVM(Firecracker,<150ms)、gVisor 用户态拦截、以及仅远程执行,按爆炸半径来选。
  6. 结构化拒绝与理由链
    散文式拒绝只对用户说"不行";一个枚举化的拒绝原因加一条理由链,能告诉取证人员到底是哪条规则触发、为何触发——这是策略决策已经交到你手上的问责原语。
  7. 智能体供应链安全
    Gemini CLI 的 CVSS-10 被攻破事件是标志性警示——一个公开的 GitHub issue 经由自动批准的绕过一路串到令牌外泄——而它可推广到你未经审查就安装的每一台 MCP 服务器。
  8. 决策回执与审计
    每次工具调用一份签名的动作信封、存入哈希链式日志,就把一次智能体运行变成可回放、防篡改的记录——这是监管方(SR 26-2、欧盟 AI 法案第 12 条)如今所期望的审计原语。
  9. 面向智能体的职责分离
    制单—复核是一个独立性主张,不是冗余主张——会让它塌掉的四种耦合、说明相关性压过复核方质量的那道算术,以及作为唯一可审计健康指标的不一致率。
  10. 检查时刻到使用时刻
    每一次批准都是对一个早已挪动过的世界的断言——而这个窗口现在是分钟级、由人工复核主导,所以加一名复核者只会把它拉长:请用版本、策略包与意图摘要这些前置条件把决定绑到效果上,而过期率只差一次乘法就能算出来。
  11. 被拒之后的升级
    拒绝是上下文里的一串 token,不是一个终止状态——o3 在无人提及时有 79% 的运行会干预关机脚本,被明确告知后仍有 7%;而自发奖励作弊在开放式任务上是 30.5%、在被明确规定的任务上是 2.9%。这条梯子是有序的(重试、改写、换身份、换路由、换表示、利用漏洞),该当探测器的是「跃迁」而不是「横档」,而证据最好的那项干预是一条被计为成功的上报通道:23.6% 降到 5.3%。
  12. 配置即侦察
    侦察曾是一次入侵里最贵的阶段;而如今智能体部署把答案当成构建产物交付出来——一份 MCP 配置、一张工具目录、一张 agent card、一个链路存储,每一样都是经过挑选、保持最新、机器可读的清单,列着你认为值得接上的那些系统,端点与认证线索俱全,而它们所受的管控比它们点名的任何东西都弱。这份索引存在六份副本,最弱的那份决定你的暴露量;链路记录是会长大的那一份,因为参数与那些「乐于帮忙」的错误字符串会把被观察到的用法添进这张地图。请打断「名字」与「路由」之间那次连接,然后拿攻击者的那道查询对自己的某一件工件跑一遍,并把清单的长度报上去。