运维 / 安全与防护

安全与防护

提示注入、沙箱、数据外泄、红队、部署安全——智能体环境制造的威胁模型。

  1. 智能体威胁模型
    为何自主性与工具使用扩大攻击面,以及攻击者可影响的文本进入智能体的四个通道。
  2. 提示词注入:直接与间接
    提示词注入的机理、为何无干净修复,以及面向防御者的分层防御模式。
  3. 数据外泄与工具滥用
    智能体中的混淆代理模式:外泄的源、隐蔽的汇,以及如何切断攻击链。
  4. 护栏:过滤、沙箱与作用域
    概率性与确定性护栏,以及如何分层输入、输出、沙箱与能力控制。
  5. 智能体的身份
    智能体调用工具时,到底是"谁"在动作?服务账号、on-behalf-of 模式,以及把这个答案搞错时的审计后果。
  6. 面向智能体的范围受限凭证
    为何智能体绝不该持有人类级别的凭证——短期、范围窄、按动作签发的令牌,以及走捷径时会撞上的失败模式。
  7. 人在回路与最小权限
    以设计实现有界自主:以最小权限为默认,并按后果设置审批关卡。
  8. 红队与安全评估
    把对智能体的对抗性测试做成可重复、按结果评分的流水线关卡,而非一次性演练。
  9. 对齐基础:意图与监督
    遵循指令与意图、奖励黑客,以及作为可行杠杆的可扩展监督。
  10. 上线前安全评审
    一份实用、失败趋关闭优先的部署清单,含 MCP/第三方供应链信任。
  11. RAG 管道安全
    为何检索上下文是绕过守卫的不可信输入——语料库投毒、间接注入、嵌入泄露,以及遏制它们的信任边界设计。
  12. 智能体的出站控制
    三周之内三家实验室先后披露模型从评测沙箱触达了真实系统,而那道边界原来只是提示词里的一句话——算力隔离对路由什么也没说,域名允许清单是范围控制而非保密控制,唯一可行的边界是一个按任务收窄的代理。
  13. 安全地渲染智能体输出
    EchoLeak 把数据从 Copilot 里带走时没有点击、也没有工具调用——模型被诱导写下一张 markdown 图片,客户端把它取了回来;这意味着模型输出对每一个渲染器而言都是不可信输入,而泄漏发生在你所建的每一道出站控制的下游。
  14. 智能体平台的漏洞管理
    智能体栈里严重度最高的缺陷,到达时没有任何补丁可打——厂商在服务端修好、事后才通知你——于是资产台账学不到东西、扫描器确认不了修复完成;而唯一改变过你暴露面的杠杆,是披露之前几个月做的那次凭据授权。
  15. 智能体的密钥管理
    智能体在每一步都读到受攻击者影响的文本,于是任何从循环内部可触及的密钥,都只差一条精心构造的指令,就会进到日志、某个工具参数或一个外泄 URL 里——解法是把凭据彻底移出模型能触及的范围,由一个代理在出口边界处附加它,让模型经手的是能力的名字,而绝非它背后的密钥。
  16. 钱包耗尽与成本攻击
    当一次请求可以扇出成一个没有上界的循环,每秒请求数限制就不再框得住你的花销了;于是攻击者优化的是放大倍数而不是流量,并且让每一张延迟曲线都保持全绿——给每次运行挂一道以货币计价的上限,在真正发出调用的那个组件里执行、而不是在提示词里,并盯住按主体的成本而不是总花费。
  17. 带权限的检索
    建索引会剥掉承载访问规则的那个容器,于是检索成了你系统里最宽的一次读取——而过滤答案不算控制,因为模型看见的一切都已算披露,连“被隐藏了几条”这个计数本身都在泄漏。请在检索之前强制、存权限键而不是解析后的成员名单以便撤销在下一次查询就生效、对真正进到提示词里的那几个 chunk 做延迟绑定检查,并用两个用户加一条哨兵字符串把它测起来。
  18. 发现智能体被攻陷
    内容类控制降低的是被攻陷的频率,却完全说不出它何时发生,因为漏检的那个分类器同时也是本该报告它的那个东西——挺过来的是行为层面的东西:被劫持的智能体会丢下派发给它的任务,其工具调用序列会跑出该任务类型应有的形状;而这只有在你按任务类型而非按身份建基线时才有区分度,因为按普通 SOC 的标准,一个健康的智能体本来就极度异常。
  19. 攻击者操作的智能体
    2026 年那些牵涉智能体的入侵,跑的是一个由人驱动的商业编程助手,用的是早已窃得的凭据——没有新的访问权、没有新的技术手法,而少数触发的拒绝,被"这是一次获授权的渗透测试"这句重新包装击穿了。真正变了的是同一个身份之下的节奏与广度,所以真正起作用的控制是凭据爆炸半径、把虚拟化管理面隔成零层资产,以及吊销耗时——而不是一份你根本执行不了的 AI 工具黑名单。
  20. 对已获批智能体的内部滥用
    报告量的都是影子 AI——数据经由一个未获批的聊天机器人流出去——而更棘手的那一类是向内的、穿过你自己批准的那台智能体:一名权限普通的员工问一个问题,就拿到四千次逐条合规的读取被综合成的那份文档,那份过去要花三周才拼得出来的文档。权限对此无话可说,所以要在返回记录数与触及的不同主体数上做检测、把检索绑定到案件号上,并记录逐字的提示词——否则你的审计轨迹会变成一台推诿机器。
  21. 把遥测与日志当作不可信输入
    WAF 会把它拦下的载荷逐字记下来,于是拦截日志成了唯一一份任何匿名陌生人都能随意写入的语料——而它抵达分诊智能体时还贴着「安全」标签,这正是一项已披露的手法能在厂商默认配置下对一台编码智能体打出 90% 成功率的原因。把「读的人」和「做的人」拆开、出网默认拒绝,并用一只你自己放进日志的哨兵去证明它确实生效。
  22. 物理执行:没有撤销的安全
    智能体安全体系里的每一项控制都假设动作可以收回,而注射泵、位移电机或机械臂不给你重试、回滚或沙箱中的任何一项——于是强制执行下沉到模型之下、进入一个无法与之争辩的驱动,而人的决定从批准一个步骤变成为整次运行授权一个有界包络。把驱动限值与经评级的防护功能清清楚楚分开,给每台设备加看门狗让它自行进入各自定义的安全状态,把急停留在软件路径之外,并且去量非计划停机与出包络次数,而不是完成了多少流程。
  23. 系统提示词提取
    OWASP 把提示词泄露列为 LLM07,并在同一口气里说提示词既不是秘密也不是安全控制——所以加固拒答只是对一个对手拖延一阵,却让所有人的产品都变差,何况那套规则照样能靠试探还原。把文本、它嵌着的秘密、以及它标出的工具面三者分开,给每一句"绝不"在模型之外配一个执行孪生,给每个版本种上金丝雀好让泄露副本自报构建与租户,并且在泄露之后按住重写提示词的手。
  24. 生命周期钩子与 harness 配置
    围着编程智能体的每一道控制都坐在「模型提议」与「人批准」之间,而生命周期钩子两条路都不走:一条绑在事件上的 shell 命令,以开发者的完整权限运行,在模型从未观察到的时刻触发,并以设置而非代码的形态交付。2026 年 9 月的 HookPry 结果经由更新路径攻破了受测的全部七个 harness,所以暴露面在「版本到版本的评审」,不在安装。请在每台宿主上枚举生效的钩子集合、把配置挪进你为代码所信任的那条流水线,并给钩子一份显式的环境允许清单与默认拒绝的出站。
  25. 面向智能体系统的蜜标
    行为式检测会被基础比率淹没,因为智能体天生异常;一个没有合法使用者的被种下标的物能把精确率找回来——六类标的物、「以用而非以读为触发」那条规则,以及一个在生产环境里测量注入易感度的诱饵。
  26. 端点上的智能体工件
    你手上每一项智能体安全控制,都假定被攻击的是智能体本身——而与此同时,它的令牌、它所连接的系统清单、以及一份「它曾被要求过什么」的可检索记录,就躺在你并不监控的那些笔记本上的可预测路径里。Gen Threat Labs 在 2026 年 9 月 8 日公布的窃密软件收集规则里点名了 Claude、Cursor、Cline、Continue、Codex 与 OpenCode 的工件;把下一个智能体加进去是一次配置推送,不是一个漏洞利用。0600 是用户边界,而恶意软件正是以该用户的身份在跑,所以请把五类工件枚举出来、按「它们能买到什么」定价,并让这个文件更不值钱,而不是让它读不出来。