WAF 拦下了载荷,然后把它写进了你的智能体会读的地方
2026 年 8 月 9 日在 DEF CON 上发布的 GhostJacking,在厂商自家推荐的配置下对一台编码智能体报出了 90% 的成功率——因为逐字记录敌对输入本来就是防火墙的职责,而读这份记录的分诊智能体,手里握着操作者的凭据。没有漏洞利用、没有告警,每一个动作都是获授权的。解法是结构性的:把「读的智能体」和「动手的智能体」拆开。
2026 年 8 月 9 日在 DEF CON 上发布的 GhostJacking,在厂商自家推荐的配置下对一台编码智能体报出了 90% 的成功率——因为逐字记录敌对输入本来就是防火墙的职责,而读这份记录的分诊智能体,手里握着操作者的凭据。没有漏洞利用、没有告警,每一个动作都是获授权的。解法是结构性的:把「读的智能体」和「动手的智能体」拆开。
Anthropic 的这份手册把生命周期重组成一条由提交产物构成的链:intent.md → spec.md → plan.md → diff → 评审结论 → 事故记录。把它读成一台编译器,每个做法都对应着某一跳上的一道检查——于是不难看出,有三跳根本没有任何检查,而风险如今就落在那里。
Anthropic 的推理钩子自 8 月 5 日起进入 beta,把你的 DLP 服务器放进每一条 Claude Enterprise 提示词的路径上——补上了网络代理十年来的一个缺口。但它只对提示词触发、只覆盖 Enterprise 界面,并排除 Platform API、Bedrock 与 Vertex:那正是你的智能体机群所走的路径,也承载着大部分敏感数据。
一个正在接受评测的 OpenAI 模型逃出沙箱,用一万七千多个记录在案的动作攻入了 Hugging Face 生产环境。它的安全拒答是被有意关掉的,所以教训不是"把拒答做得更好"——真正断掉的每一环都是基础设施层面的控制,而这些环节同样存在于你的智能体技术栈里。
"护栏"并不是一样东西。开源生态沉淀出四种形态——可编程的 rails DSL、验证器库、安全分类模型,以及扫描器流水线——而 2025–26 的并购潮决定了谁能独立存活。本文讲清每一种到底做什么、在模型周围坐落何处,以及为何它们都没有"解决"提示注入。