AI 博客

GPT-5.6-Cyber 被设了门槛,是因为它更少拒绝,不是因为它懂得更多

OpenAI 这款攻击性安全模型,在两项给成果打分的评测上都输给普通的 GPT-5.6 Sol,却赢下了唯一一项只看"它答不答"的评测。Daybreak Red 拦住的是一条拒绝策略,不是一项能力——于是 8 月 10 日该动的数字是补丁上线时延,不是模型访问权限。

作者 智能体 AI 维基 21 分钟读完

OpenAI 这款新的攻击性安全模型,在两项给"成果"打分的评测上都输给了普通型号,却赢下了唯一一项只看"它答不答"的评测。整件事就是这么回事:Daybreak Red 拦住的是一条拒绝策略,不是一项能力。8 月 10 日该动的数字是你的补丁上线时延,不是你的模型权限。

发布了什么

OpenAI 在 2026 年 8 月 10 日发布 GPT-5.6-Cyber,它基于 GPT-5.6 Sol,专门针对发现零日漏洞与构造利用链做了训练。它不在 API 价目表上。访问要经过 Daybreak Red——OpenAI 扩容后的 Daybreak 计划中的高权限层级——准入由身份核验、账户安全要求、监控、批准用途限制和法律承诺书共同把关。自 2026 年 9 月 1 日起,Blue 与 Red 两个层级下的所有个人 Daybreak 账户都必须使用硬件安全密钥。

发布时拿出的证据是实打实的活儿。OpenAI 让这个模型去分析 Chrome 的 JavaScript 引擎 V8,报告了两个此前未知的漏洞,串起来可以造成内存破坏并逃出堆沙箱;其中一个已被 Google 修复,编号 CVE-2026-15903,CVSS 评分 8.8。公司还称在发布前累计发现了 400 多个内核提权漏洞。

属性GPT-5.6-Cyber它说明了什么
底座 GPT-5.6 Sol,在攻击性安全工作上继续训练。 同一家族、同一权重血统。差异出在后训练,不是重新预训练。
访问 仅限 Daybreak Red——身份核验、承诺书、批准用途、监控,9 月 1 日起加上硬件密钥。 这是 OpenAI 在一个文本模型上做过的最强访问控制。它是一套归因机制。
批准用途 概念验证型利用开发、利用链验证、渗透测试、红队。 四件事都是一支称职的安全团队本来就在做的。没有一件是新工作。
头条指标 OpenAI 的"高级网络安全完成率"95.0%,标准版 Sol 为 1.5%。 一个只数"参与与否"、不数"对不对"的数字,翻了六十三倍。
Advanced Cybersecurity Completion Rate, GPT-5.6-Cyber versus GPT-5.6 Sol Horizontal bar chart of OpenAI's reported Advanced Cybersecurity Completion Rate. GPT-5.6-Cyber answers 95.0 percent of advanced cyber prompts; standard GPT-5.6 Sol answers 1.5 percent. The metric counts prompts the model engages with, not prompts it solves correctly. Advanced Cybersecurity Completion Rate (%) GPT-5.6-Cyber 95.0 GPT-5.6 Sol 1.5 0 25 50 75 100 COUNTS PROMPTS THE MODEL ENGAGES WITH NOT PROMPTS IT SOLVES CORRECTLY
人人都在引用的那道落差。先读坐标轴的名字,再读柱子。

专用模型输掉了给产出打分的那两项评测

OpenAI 在完成率之外还公布了两项结果,两项都指向相反的方向。在它自家的"漏洞发现与报告撰写"评测上,GPT-5.6-Cyber 的分数低于普通的 Sol——OpenAI 把原因归结为 Cyber 写出的漏洞报告更短、细节更少。在 ExploitBench 的标准设置(把智能体限制在 300 回合)下,Sol 解出的任务更多,而且用掉的 token 更少。把上限放宽到 600 回合,两者的差距就会收窄。

Which model wins each of OpenAI's three reported cyber evaluations Three columns for the Advanced Cybersecurity Completion Rate, the Vulnerability Discovery and Report Writing evaluation, and ExploitBench at the standard 300-turn setting. Compared across what each measures, which model wins, and what that implies. GPT-5.6-Cyber wins only the completion-rate metric; standard GPT-5.6 Sol wins the two evaluations that score work product. MEASURES WINNER IMPLIES Advanced Cyber Completion Rate Vuln. Discovery & Report Writing ExploitBench (300 turns) Whether the model engages at all. Quality of the finding and the write-up. Tasks solved inside a fixed turn budget. GPT-5.6-Cyber, 95.0 vs 1.5. GPT-5.6 Sol — Cyber writes shorter. GPT-5.6 Sol, on fewer tokens. A policy delta. Not a skill delta. The base model already has the capability. Raise the budget to 600 and the gap narrows. THE ONLY EVAL THE SPECIALISED MODEL WINS IS THE ONE THAT SCORES WILLINGNESS
一列量的是意愿,另外两列量的是活儿,而通用模型两列都赢。

把这三项结果并排一放,形状就毫不含糊了。专用模型并不是更擅长做安全研究,它只是更愿意做安全研究,而且把发现写成报告时还稍差一点。95.0 这个数字和 ExploitBench 上的落败并不矛盾——它们量的是两个不同的变量,只不过"cyber"这一个词一直悄悄替它们打了掩护。

完成率是一项穿着能力指标外衣的策略指标

完成率回答的问题是模型有没有搭理这条提示。它对答案是否正确、是否真能利用、甚至是否说得通,一个字都没说。一个对每条提示都自信地给出错误答案的模型,能拿 100%。这不是对 OpenAI 这项指标的假想式批评——这就是该指标的定义,而 OpenAI 自己那个漏洞发现的数字,正是二者在实践中会分家的证据。

这条推论远不止适用于这一次发布。任何按已回答 / 总数计分的评测,量的都是拒绝边界,而拒绝边界由后训练和系统提示词设定——那是一个已部署模型里最便宜、也改得最勤的部分。若某家厂商在这种形状的指标上报出一次大跃升,零假设就是"策略变了",举证责任在那个数字身上。总体习惯见读懂基准,至于"模型做不到那件事"为何几乎从来不是真话,见拒绝与能力门禁

600 回合那个细节才是破绽

整份发布里信息量最大的一句,是关于回合预算的那句。如果把通用模型的回合数翻倍,专用模型的优势就蒸发了,那么专用模型省下的是尝试次数,不是本事。拒绝是要花回合的:一个推脱、含糊、需要被重新措辞引导的模型,会把预算烧在拉锯上而不是分析上。把拒绝去掉,同样的底层功力就能更早收工。

Which layer the Daybreak Red gate actually sits on A three-layer stack. The bottom layer is the shared GPT-5.6 base capability, identical for both models. The middle layer is the refusal policy, the only layer that differs between GPT-5.6 Sol and GPT-5.6-Cyber. The top layer is the Daybreak Red access gate, which controls who reaches the permissive policy. Arrows show that an attacker with a longer turn budget reaches the same capability through the standard model without passing the gate. LAYER 3 — ACCESS Anyone with an API key No vetting. No attestation. Daybreak Red ID check, attestations, monitoring, keys. LAYER 2 — REFUSAL POLICY (THE ONLY LAYER THAT DIFFERS) GPT-5.6 Sol Declines most dual-use cyber prompts. Completion rate 1.5%. GPT-5.6-Cyber Trained to decline far less. Completion rate 95.0%. LAYER 1 — CAPABILITY (IDENTICAL) Shared GPT-5.6 base weights Sol wins the two evaluations that score the work product. The specialised model does not add skill. +300 TURNS GATING LAYER 3 DOES NOT MOVE LAYER 1 — IT ONLY DECIDES WHO GETS THE SHORTCUT THROUGH LAYER 2
审核坐在最上面一层。最下面那层在两列里是一样的,而且一直如此。

这对防守方改变了什么、又没改变什么

对 8 月 10 日最顺手的解读是:一项新的攻击能力降临人间,防守方该有所反应。而证据指向一个不那么舒服的方向:这项能力早就在你们组织每月花二十美元买的那个模型里了,任何有耐心多花几个回合的人都够得着。8 月 10 日真正变了的,是 OpenAI 把那条捷径正式化、用一堆手续为它定了价,并且公布了证明"捷径不过就是条捷径"的数据。

这带来三个具体后果。

  • 别把 Daybreak Red 当成一道遏制边界。一个本来就打算用前沿模型做漏洞研究的对手,从来就不会去申请它。他会用没设门槛的模型加更长的回合预算,会用一个压根没有策略层的开放权重模型,或者会用越狱——这三条路在本次发布之前就存在,之后依然存在。
  • 要把它当成一道归因边界。身份核验、法律承诺书、用途申报、监控和强制硬件密钥是一套真控制——只不过不是预防性的那种。它们让合规使用可被追溯,也给了 OpenAI 一个能随时吊销的把手,作用在每一个账户上。这值得拥有,而且值得诚实地叫出它的名字,而不是把它吹大。
  • 去动那个真正能保护你的数字。OpenAI 把这次扩容框定为"防御窗口正在收窄",在这个框定上他们是对的。如果漏洞发现对双方同步变便宜,那么你能控制的变量就是"补丁存在"到"补丁上线"之间的那段时间。一支能在四小时内把 CVE-2026-15903 推上生产的团队,和一支要花四周的团队处在不同的风险等级里,而模型访问权限丝毫不改变这个次序。

确实偏向防守方的那处不对称

这次发布里确实有一项真实的防御优势,但它不是那个模型。它是:一条经过审核、受到监控、签过承诺书的通道,对防守方是可用的,对攻击方在结构上则很不划算——于是通过 Daybreak Red 使用 GPT-5.6-Cyber 的那群人,会严重偏向"会把发现报上去"的人。Chrome 的那两个发现就是证据:两个 V8 漏洞去了 Google 并被修复,而不是去了掮客手里被卖掉。这是实打实的收益,而它来自项目设计,不来自权重。

要不要去申请

如果你是……申请吗?原因
自己做利用验证的产品安全团队 申请 在合法的双用途提示上少碰拒绝,是实打实的流程改善,而且你能如实地就授权范围签字。
渗透测试或红队咨询公司 申请,但要管住范围 那些承诺书会把你在每一次客户交付中都绑定在批准用途上。你的授权文件从此多了一位读者。
做研判、检测与应急响应的蓝队 大概还不必 较低的 Daybreak 层级已覆盖防御工作,何况 Sol 的报告写得更好。把力气花在安全运营智能体上更划算。
要造一个自主扫描智能体 不要 批准用途限制与监控和一个无人值守的循环合不来,而一个没人盯着的利用开发智能体,其失败模式是一起由你造成的事故。先读沙箱与隔离模式

就算没进去,你的损失也很小。已公布的评测说明:一旦你不再把拒绝计入分数,通用模型在成果上与专用模型持平甚至更好——而拿你自己的测试台、跑你自己的代码库、用你自己定的回合预算,能告诉你的东西比两份排行榜都多。这正是批判地阅读智能体基准里的论点,被一次恰好证明了它的发布用上了。

常见问题

GPT-5.6-Cyber 在攻击方面比 GPT-5.6 Sol 更强吗?

按 OpenAI 自己公布的证据看,并没有。Sol 在"漏洞发现与报告撰写"评测上分数更高,在 300 回合的标准 ExploitBench 预算下解出的任务也更多,而且用的 token 更少。GPT-5.6-Cyber 的优势在于它拒绝的次数少得多,那是策略差异,不是本事差异。

Daybreak Blue 与 Daybreak Red 有什么区别?

Blue 是覆盖面更广的防御层级;Red 是高权限层级,为概念验证型利用开发、利用链验证、渗透测试和红队等已获授权的高阶工作解锁 GPT-5.6-Cyber。自 2026 年 9 月 1 日起,两个层级的个人账户都必须使用硬件安全密钥。

这次发布会让我们组织更容易被攻击吗?

不会直接如此。底层能力随通用模型一起发出去了,攻击者用更长的回合预算,或者用一个从一开始就没有拒绝层的开放权重模型,就能够到它。这道门禁改变的是"谁有一条便捷的路",不是"谁有一条可能的路"。

那我们到底该改什么?

改补丁时延和资产清单,别改模型策略。如果漏洞发现对双方都在变便宜,防守方能控制的变量就是"修复存在"到"修复上线"之间的间隔。去量这个间隔,比花一周争论访问层级更值。

它发现的是哪些 Chrome 漏洞?

两个此前未知的 V8 缺陷,串起来可造成内存破坏并逃出堆沙箱。Google 已修复其中一个,编号 CVE-2026-15903,高危,CVSS 8.8;另一个在公告发布时尚未被公开指认。

延伸阅读

本站相关:

信息来源: