AI 博客

外壳越过了气隙,模型没有

IBM 在 2026 年 10 月 1 日让自托管版 Bob 正式可用,面向本地、私有云、主权云与气隙环境,shell、并行工具调用、技能与模式完整保留。而受支持运行在客户自管基础设施上的模型是 NVIDIA Nemotron 与 Poolside Laguna——不是托管版的 Claude、Gemini 与 GPT 选项。功能清单能移植;行为得重新挣回来,这使得一次主权迁移成了一次披着基础设施外衣的评测迁移。

作者 智能体 AI 维基 23 分钟读完

把 IBM 的两份清单并排着读,主权这笔交易就不再抽象了。自托管版 Bob 于 2026 年 10 月 1 日正式可用,面向本地、私有云、主权云与气隙环境,并且把智能体外壳完整保留——shell、并行工具调用、技能、操作模式。而在正式可用时,受支持运行在客户自管基础设施上的模型是 NVIDIA Nemotron 与 Poolside Laguna;Claude Sonnet 5.0 与 Opus 4.8、Gemini 3.7 Flash 以及 GPT 5.6 Sol 出现在托管与混合配置里。能移植的那件东西,正是你的迁移清单覆盖到的那一件。而决定输出好不好的那件东西,是留在原地的那一件——这意味着你按基础设施来估算的那个气隙项目,其实是一个重新验证的项目,而你必须重建的,是你的评测套件。

一眼概览

在采购文件里,有三种姿态被叫成同一个名字,而它们的价格并不相同。

姿态代码落在哪你能运行的模型你必须重新验证什么
主权云 厂商基础设施,区域与司法辖区由合同约定 托管的前沿模型,不变 技术上基本没有
自托管 + 混合模型 你的基础设施;提示词仍会外发去做推理 经由外部服务调用的托管前沿模型 出口策略、延迟预算、失败处理
自托管或气隙 + 本地模型 代码、开发上下文与构建产物都留在里面 客户自管的开放权重模型——Bob 在正式可用时是 Nemotron 与 Laguna 提示词、技能、步数预算、评测套件、成本模型
What changes across three deployment modes of the same agent platform Three columns for sovereign cloud, self-hosted and air-gapped deployment. In all three the agent harness box is identical. The model box changes from hosted frontier models to on-premises open-weight models. The external lookup channel is present in the first two columns and severed in the air-gapped column. SOVEREIGN CLOUD SELF-HOSTED AIR-GAPPED HARNESS shell, tools, skills identical shell, tools, skills identical shell, tools, skills identical MODEL hosted frontier what you built against hosted or local hybrid is a choice local open-weight a different agent LOOKUPS docs, registries work docs, registries policy-gated docs, registries severed no route out, by design The only row that is genuinely unchanged is the top one — and it is the row the product page describes. The middle row decides output quality. The bottom row decides whether a missing lookup fails loudly or becomes a guess.
只有一行是真正没变的,而那一行恰恰就是产品页所描述的那一行。

功能清单移植过去了;行为没有

IBM 的说法是准确的,而它同时也是困惑的来源。Bob 是一个智能体式软件开发平台——读懂代码、规划工作、执行变更、校验结果——而自托管版确实保留了让它成为这件东西的那些能力:shell、IDE 体验、并行工具调用、技能、模式。如果你列出开发者直接打交道的东西,其中几乎全部都越过了气隙。

但那些能力里没有一项决定一个补丁是否正确。外壳决定智能体能尝试什么;模型决定这次尝试多久才落地一次。在一个完全相同的外壳底下换掉模型,你改动的是用户体验实际上唯一依赖的那个变量,而每一件在你与模型之间作中介的产物——系统提示词、技能、工具说明、步数上限、重试策略、验收阈值——都还钉在一个你已不再运行的模型上。

那些产物不是配置。它们是测量结果。一份成熟的智能体提示词是某一个模型失败分布的压缩日志:这一条存在是因为那个模型丢过文件路径,那一条是因为它改得过多,这个阈值是因为它的置信度在某个特定方向上失准。把它们原样搬过去,你要付两笔账——花在压制「新模型并不具备的失败」上的令牌,以及对「它确实具备的那些失败」一条条款也没有。这就是提示词可移植性里的那个普遍问题;气隙只是那个你无法推迟的版本。

把模型矩阵读作价目表

What crosses an air gap and what does not Three columns. The harness crosses intact, carrying the shell, parallel tool calling, skills and modes. The model does not cross: the models supported inside are open-weight ones rather than the hosted frontier options. External lookups are cut entirely and must be mirrored inside or they become guesses. CROSSES INTACT The harness shell, parallel tool calls, skills, operating modes this is the feature list on the product page DOES NOT CROSS The model inside: open-weight, customer-managed every prompt and eval calibrated elsewhere CUT ENTIRELY The lookups docs, package index, tool registry, judge mirror them inside, or they become guesses Only the first column is what a migration checklist usually covers. The second and third are where the work is, and both land on the eval suite.
什么越过了、什么没有,以及你的迁移计划讲的是哪一列。

面对任何厂商的主权版或气隙版方案,实用的阅读建议是:跳过能力页,直接去看受支持模型矩阵,因为那张表才是规格书。如果为客户自管基础设施认证的模型与托管清单不同——而在 Bob 正式可用时确实不同——那么厂商已经精确地、公开地告诉了你:你的隔离要求要花掉你哪一个模型档位。

这不是在批评这种安排;这是交付它唯一诚实的方式。一套气隙部署只能运行客户有授权持有、且有硬件可供服务的权重,这就排除了所有「权重不出实验室」的模型。NVIDIA Nemotron 与 Poolside Laguna 在那张清单上,是因为它们能在;而一个承诺「在气隙之内给你托管前沿级质量」的厂商,承诺的是没人交付得出的东西。

由此得出的,是对项目计划的重新框定,而不是放弃它的理由。

  • 在气隙闭合之前做模型对比,而不是之后。把候选的本地模型在你平常的环境里立起来,把现有任务集指向它,在你还同时握着两边的时候把差距读出来。事后才去测的团队分不清「模型回归」与「依赖断掉」,因为在气隙之内这两者都表现为「它变差了」。
  • 重新定预算的尺寸,而不只是改提示词。如果本地模型完成同一任务需要更多步数,那你的步数上限、超时与上下文预算全都是照着另一个模型定的。症状是「被截断的运行莫名增多」,它读起来像个基础设施问题,而它不是。
  • 把成本模型从令牌切换到容量。气隙之内没有按令牌计费的账单,也没有弹性突发。你要么按峰值并发做容量并吃下 GPU 空转,要么实现准入控制并吃下排队。每完成任务的成本依然是对的指标;只是那个分母不再是一张厂商发票。

那些没人写下来的依赖

Which assets need re-validation in each deployment mode A matrix with five asset rows — prompts and skills, tool schemas, step and timeout budgets, the eval suite, and the cost model — against three deployment modes. Sovereign cloud leaves nearly everything unchanged, self-hosted requires re-checks, and air-gapped requires most assets to be re-earned against a different model. Re-validation surface by deployment mode SOVEREIGN CLOUD SELF-HOSTED AIR-GAPPED Prompts & skills unchanged re-check re-earn Tool schemas unchanged re-check re-check Step & timeout budgets unchanged re-check re-size Eval suite + judge unchanged re-host judge rebuild inside Cost model per-token capacity, not tokens capacity, not tokens unchanged needs a re-check needs rebuilding or re-earning Rows two and three are the quiet ones: a different model changes schema tolerance and how many steps a task takes.
重新验证的面。第二行与第三行是安静的那两行。

编码智能体是一个不断在查东西的程序,而那些查询里的大多数从来都不是架构决策。切断网络之后,它们并不会抛异常——模型改为从自己的权重里作答,而这是可选失败模式里最糟的一种,因为它与「正常工作」无从区分。

版本查询是那个典型案例。此前能读软件包索引的智能体,现在是凭记忆说出一个版本号,受限于一个它无从示意的知识截止。工具注册表是同一个形状:发现停止,智能体只能按「上次刷新时还算新的那份本地目录」干活。你评测流水线里的那个托管评判模型会直接报错、或无声跳过——于是可观测性最差的那个环境,最终变成了彻底没有质量闸门在跑的那一个。遥测与错误上报掉进虚空。证书吊销检查与 NTP 会间歇性失败,造出那起「看起来什么事都没有」的凌晨三点事故。

上面每一项都有解——镜像一份文档语料、一个内部软件包索引、一份刷新过的工具目录、一个在本地托管并在你已有标注集上校准过的评判模型——而它们没有一项会出现在「照着产品页写出来的」迁移清单上。能把它们揪出来的那次测试只要一天:在一个其他方面完全相同的预发环境里封掉对外访问,跑完整的任务集,然后数两件事。有多少次工具调用失败了,以及有多少次运行给出了一个自信的错误答案而不是直接失败。第二个数才是气隙的真实代价。

气隙还给你的那一件东西

把好处说公道是值得的,因为它是真的,而且被低估了:在气隙之内,没有东西会在你脚下悄悄变。不会有无声的端点升级,不会有默认力度设置在某个周二自己挪位,也不会有你没排进计划的弃用窗口。版本归你——这正是我们在别处作为固定与验证所主张的那个姿态,只是这次由拓扑结构来强制,而不是靠纪律。

这笔好处的账单以一套发布流程的形式抵达。模型版本、容器镜像、工具服务器、依赖项与漏洞情报源,现在都要经由一次刻意的、经认证的导入才能越过;而一套没人排期的刻意流程,其默认结局就是十一个月没更新过任何东西。请给导入定一个节奏并指定负责人,对一切入口内容按摘要与签名逐一验证——传输介质现在就是你的供应链——并把安全公告源镜像进来,因为隔离并不会修补任何东西,它只是拿掉了你的通知通道。

还要在你需要之前就把例外通路写下来。当一次生产事故需要厂商帮忙、而厂商什么都看不到时,现场临时想出来的答案就是有人拿手机把日志拍下来。请预先决定什么可以出去、以何种方式脱敏、由谁批准。

什么时候该选哪一种

如果你真正的要求是……主权云自托管 + 混合模型气隙 + 本地模型
数据留在指定的司法辖区内够用,而且最便宜用力过猛用力过猛
源代码绝不触达第三方 AI 服务做不到做不到——提示词仍会外发能,这正是它回答的那个场景
可得的最佳模型质量能能不能,而矩阵已经这么写了
向审计人员展示得出的隔离仅限合同层面部分能,而且只有它能
未经你批准,什么都不许变做不到部分能——代价是一套发布流程

这张表上最常见的错误,是为了满足第一行的要求而买下第三行的代价。如果你真正拥有的是一条数据驻留条款,那么停在主权云是一个正当的答案,而且它保住了你当初据以构建的那个模型。

常见问题

自托管版 Bob 到底能不能跑前沿模型?

经由混合与私有 SaaS 配置,能——Claude Sonnet 5.0 与 Opus 4.8、Gemini 3.7 Flash 以及 GPT 5.6 Sol 就列在那里。但混合配置会把提示词发给一个外部服务,这回答的是数据驻留要求,而回答不了隔离要求。在正式可用时,受支持运行在客户自管基础设施上的模型是 Nemotron 与 Laguna。

这件事只发生在 IBM 身上吗?

不是。任何交付气隙版智能体产品的厂商都面对同一条约束——你只能运行客户可以持有的权重——所以「外壳可移植、模型档位改变」这个模式是结构性的,而不是 IBM 的某个选择。IBM 是个有用的案例,因为它的矩阵把这道劈分明说了出来,而不是留给你去推断。

我实际上会损失多少质量?

抽象地问是不可知的,而在你自己的场景里测很便宜:在拍板之前拿你的任务集跑一遍候选的本地模型,并比较每完成任务的成本,而不是比较一个基准分数。答案取决于具体工作负载;而对于界定清晰、测试良好的任务,它往往远小于榜单差距所暗示的。

我现有的评测套件还能用吗?

任务定义能。评判模型通常不能——一个托管的评判模型就是一项出口依赖,所以你要在内部重新托管一个更小的评判模型,并在你已有的标注集上重新校准它,因为换一个评判模型就是换一个指标。在基准真值可以按规则比较的地方,优先用规则,把这项依赖彻底去掉。

一个气隙项目会搞砸,最好的单一预测指标是什么?

在拍板之前,没有任何人在封掉对外访问的条件下跑过完整的任务集。那一个实验能在一个下午里让每一项隐式依赖现形,而省掉它,正是这类迁移总是被「撞见」而不是被「规划」的原因。

延伸阅读

本站相关:

原始来源: