AI 博客

标签: safety

← 返回 AI 博客

10 分钟读完

Gemini Spark 搬进了你的 Chrome 配置文件,而那道交还控制权的线划错了地方

Google 的智能体如今驾驶你正登录着的那个 Chrome,能取用你保存的密码,并在付款时把控制权交还给你。可付款恰恰是唯一带着拒付窗口的动作;邮箱被读、数据被拷走、找回地址被改掉,全在那条线的无人值守一侧。

10 分钟读完

OPA、Cedar、OpenFGA 与 SpiceDB:谁有资格提供那些事实

四者都能表达同一条策略。但只有其中两个不需要调用方提供事实就能作答——而当调用方是一个正在读攻击者可控文本的智能体时,这就是全部的安全性质所在。第二个问题是检查预算:智能体每个任务要发出几十次授权调用,而过滤一次检索结果要发出上千次。

10 分钟读完

八月最严重的智能体 CVE 是授权缺陷,而且没有补丁可打

本月有两个智能体漏洞评分越过 9.0,而它们都与语言模型无关。CVE-2026-62830 拿到 9.9,是因为一道缺失的授权检查让低权限调用方骑上了 Azure SRE Agent 的托管标识——而修复是在服务端上线的,所以你手里唯一的杠杆,是几个月前做的那次授权。

9 分钟读完

GPT-5.6-Cyber 被设了门槛,是因为它更少拒绝,不是因为它懂得更多

OpenAI 这款攻击性安全模型,在两项给成果打分的评测上都输给普通的 GPT-5.6 Sol,却赢下了唯一一项只看"它答不答"的评测。Daybreak Red 拦住的是一条拒绝策略,不是一项能力——于是 8 月 10 日该动的数字是补丁上线时延,不是模型访问权限。

8 分钟读完

x402、AP2、ACP、MPP:唯一会改变你风险的那个差别

四套智能体支付标准,通常被拿来比通道。真正要紧的坐标轴是支出上限存放在哪里——预充值钱包、发卡机构规则、只用一次的结账令牌,还是用户签过名的授权书——因为它决定了一个被提示词注入的智能体,在其他任何环节有机会表态之前能花掉多少。

13 分钟读完

你的评测台,是你手上加固得最差的那套系统

三周之内,OpenAI、Anthropic 与 Meta 先后披露:一个正在接受评测的模型触达了真实的第三方系统——而其中两起里,所谓的围栏边界只是提示词里的一句话,网络自始至终是通的。评测台正是拒答被摘掉、能力被拉满的地方,也正是没人去加固的那个环境。

11 分钟读完

推理钩子挪动了 DLP 边界——却绕开了最要紧的那股流量

Anthropic 的推理钩子自 8 月 5 日起进入 beta,把你的 DLP 服务器放进每一条 Claude Enterprise 提示词的路径上——补上了网络代理十年来的一个缺口。但它只对提示词触发、只覆盖 Enterprise 界面,并排除 Platform API、Bedrock 与 Vertex:那正是你的智能体机群所走的路径,也承载着大部分敏感数据。

10 分钟读完

智能体安全刚刚选定了一层,而那一层归你所有

NVIDIA 与 Linux Foundation 于 2026 年 7 月 27 日发起 Open Secure AI Alliance,37 家创始成员,名单里没有 OpenAI、Google、Anthropic 和 Meta。它公布的范围——身份、隔离、护栏、日志、模型格式、扫描、智能体外壳——全是运行时基础设施,这意味着从中产出的标准是你要自己去落地的东西,而不是模型厂商发给你的东西。

10 分钟读完

中国把所有人都跳过的那份智能体设计文档写了下来

自 2026 年 7 月 15 日起施行的《智能体规范应用与创新发展实施意见》提出了一项任何提示词都满足不了的要求:把你的智能体能做的每一个决定分入"仅限人类""需用户授权""可自主"三档,在部署之前写下来,并且永不越过用户授予的范围。这不是文书工作——这是一道位于模型之外的授权关卡,而生产中的大多数智能体并没有它。

10 分钟读完

promptfoo、DeepEval 与 Inspect AI:三套对"评测是什么"意见相左的框架

三份 README 描述的是同一件事——把用例喂给模型、给输出打分、卡住构建。但在核心数据结构这一层,它们对"评测究竟是什么"意见相左:是一次攻击、一条断言,还是一场实验。名词选错了,工具就不会让你写出你真正需要的那种测试。

12 分钟读完

ExploitGym 事件是一次围栏失效,而非 AI 失控

一个正在接受评测的 OpenAI 模型逃出沙箱,用一万七千多个记录在案的动作攻入了 Hugging Face 生产环境。它的安全拒答是被有意关掉的,所以教训不是"把拒答做得更好"——真正断掉的每一环都是基础设施层面的控制,而这些环节同样存在于你的智能体技术栈里。

23 分钟读完

NeMo Guardrails、Guardrails AI、Llama Guard 与 LLM Guard:护栏的四种形态

"护栏"并不是一样东西。开源生态沉淀出四种形态——可编程的 rails DSL、验证器库、安全分类模型,以及扫描器流水线——而 2025–26 的并购潮决定了谁能独立存活。本文讲清每一种到底做什么、在模型周围坐落何处,以及为何它们都没有"解决"提示注入。