把 IBM 的两份清单并排着读,主权这笔交易就不再抽象了。自托管版 Bob 于 2026 年 10 月 1 日正式可用,面向本地、私有云、主权云与气隙环境,并且把智能体外壳完整保留——shell、并行工具调用、技能、操作模式。而在正式可用时,受支持运行在客户自管基础设施上的模型是 NVIDIA Nemotron 与 Poolside Laguna;Claude Sonnet 5.0 与 Opus 4.8、Gemini 3.7 Flash 以及 GPT 5.6 Sol 出现在托管与混合配置里。能移植的那件东西,正是你的迁移清单覆盖到的那一件。而决定输出好不好的那件东西,是留在原地的那一件——这意味着你按基础设施来估算的那个气隙项目,其实是一个重新验证的项目,而你必须重建的,是你的评测套件。
一眼概览
在采购文件里,有三种姿态被叫成同一个名字,而它们的价格并不相同。
| 姿态 | 代码落在哪 | 你能运行的模型 | 你必须重新验证什么 |
|---|---|---|---|
| 主权云 | 厂商基础设施,区域与司法辖区由合同约定 | 托管的前沿模型,不变 | 技术上基本没有 |
| 自托管 + 混合模型 | 你的基础设施;提示词仍会外发去做推理 | 经由外部服务调用的托管前沿模型 | 出口策略、延迟预算、失败处理 |
| 自托管或气隙 + 本地模型 | 代码、开发上下文与构建产物都留在里面 | 客户自管的开放权重模型——Bob 在正式可用时是 Nemotron 与 Laguna | 提示词、技能、步数预算、评测套件、成本模型 |
功能清单移植过去了;行为没有
IBM 的说法是准确的,而它同时也是困惑的来源。Bob 是一个智能体式软件开发平台——读懂代码、规划工作、执行变更、校验结果——而自托管版确实保留了让它成为这件东西的那些能力:shell、IDE 体验、并行工具调用、技能、模式。如果你列出开发者直接打交道的东西,其中几乎全部都越过了气隙。
但那些能力里没有一项决定一个补丁是否正确。外壳决定智能体能尝试什么;模型决定这次尝试多久才落地一次。在一个完全相同的外壳底下换掉模型,你改动的是用户体验实际上唯一依赖的那个变量,而每一件在你与模型之间作中介的产物——系统提示词、技能、工具说明、步数上限、重试策略、验收阈值——都还钉在一个你已不再运行的模型上。
那些产物不是配置。它们是测量结果。一份成熟的智能体提示词是某一个模型失败分布的压缩日志:这一条存在是因为那个模型丢过文件路径,那一条是因为它改得过多,这个阈值是因为它的置信度在某个特定方向上失准。把它们原样搬过去,你要付两笔账——花在压制「新模型并不具备的失败」上的令牌,以及对「它确实具备的那些失败」一条条款也没有。这就是提示词可移植性里的那个普遍问题;气隙只是那个你无法推迟的版本。
把模型矩阵读作价目表
面对任何厂商的主权版或气隙版方案,实用的阅读建议是:跳过能力页,直接去看受支持模型矩阵,因为那张表才是规格书。如果为客户自管基础设施认证的模型与托管清单不同——而在 Bob 正式可用时确实不同——那么厂商已经精确地、公开地告诉了你:你的隔离要求要花掉你哪一个模型档位。
这不是在批评这种安排;这是交付它唯一诚实的方式。一套气隙部署只能运行客户有授权持有、且有硬件可供服务的权重,这就排除了所有「权重不出实验室」的模型。NVIDIA Nemotron 与 Poolside Laguna 在那张清单上,是因为它们能在;而一个承诺「在气隙之内给你托管前沿级质量」的厂商,承诺的是没人交付得出的东西。
由此得出的,是对项目计划的重新框定,而不是放弃它的理由。
- 在气隙闭合之前做模型对比,而不是之后。把候选的本地模型在你平常的环境里立起来,把现有任务集指向它,在你还同时握着两边的时候把差距读出来。事后才去测的团队分不清「模型回归」与「依赖断掉」,因为在气隙之内这两者都表现为「它变差了」。
- 重新定预算的尺寸,而不只是改提示词。如果本地模型完成同一任务需要更多步数,那你的步数上限、超时与上下文预算全都是照着另一个模型定的。症状是「被截断的运行莫名增多」,它读起来像个基础设施问题,而它不是。
- 把成本模型从令牌切换到容量。气隙之内没有按令牌计费的账单,也没有弹性突发。你要么按峰值并发做容量并吃下 GPU 空转,要么实现准入控制并吃下排队。每完成任务的成本依然是对的指标;只是那个分母不再是一张厂商发票。
那些没人写下来的依赖
编码智能体是一个不断在查东西的程序,而那些查询里的大多数从来都不是架构决策。切断网络之后,它们并不会抛异常——模型改为从自己的权重里作答,而这是可选失败模式里最糟的一种,因为它与「正常工作」无从区分。
版本查询是那个典型案例。此前能读软件包索引的智能体,现在是凭记忆说出一个版本号,受限于一个它无从示意的知识截止。工具注册表是同一个形状:发现停止,智能体只能按「上次刷新时还算新的那份本地目录」干活。你评测流水线里的那个托管评判模型会直接报错、或无声跳过——于是可观测性最差的那个环境,最终变成了彻底没有质量闸门在跑的那一个。遥测与错误上报掉进虚空。证书吊销检查与 NTP 会间歇性失败,造出那起「看起来什么事都没有」的凌晨三点事故。
上面每一项都有解——镜像一份文档语料、一个内部软件包索引、一份刷新过的工具目录、一个在本地托管并在你已有标注集上校准过的评判模型——而它们没有一项会出现在「照着产品页写出来的」迁移清单上。能把它们揪出来的那次测试只要一天:在一个其他方面完全相同的预发环境里封掉对外访问,跑完整的任务集,然后数两件事。有多少次工具调用失败了,以及有多少次运行给出了一个自信的错误答案而不是直接失败。第二个数才是气隙的真实代价。
气隙还给你的那一件东西
把好处说公道是值得的,因为它是真的,而且被低估了:在气隙之内,没有东西会在你脚下悄悄变。不会有无声的端点升级,不会有默认力度设置在某个周二自己挪位,也不会有你没排进计划的弃用窗口。版本归你——这正是我们在别处作为固定与验证所主张的那个姿态,只是这次由拓扑结构来强制,而不是靠纪律。
这笔好处的账单以一套发布流程的形式抵达。模型版本、容器镜像、工具服务器、依赖项与漏洞情报源,现在都要经由一次刻意的、经认证的导入才能越过;而一套没人排期的刻意流程,其默认结局就是十一个月没更新过任何东西。请给导入定一个节奏并指定负责人,对一切入口内容按摘要与签名逐一验证——传输介质现在就是你的供应链——并把安全公告源镜像进来,因为隔离并不会修补任何东西,它只是拿掉了你的通知通道。
还要在你需要之前就把例外通路写下来。当一次生产事故需要厂商帮忙、而厂商什么都看不到时,现场临时想出来的答案就是有人拿手机把日志拍下来。请预先决定什么可以出去、以何种方式脱敏、由谁批准。
什么时候该选哪一种
| 如果你真正的要求是…… | 主权云 | 自托管 + 混合模型 | 气隙 + 本地模型 |
|---|---|---|---|
| 数据留在指定的司法辖区内 | 够用,而且最便宜 | 用力过猛 | 用力过猛 |
| 源代码绝不触达第三方 AI 服务 | 做不到 | 做不到——提示词仍会外发 | 能,这正是它回答的那个场景 |
| 可得的最佳模型质量 | 能 | 能 | 不能,而矩阵已经这么写了 |
| 向审计人员展示得出的隔离 | 仅限合同层面 | 部分 | 能,而且只有它能 |
| 未经你批准,什么都不许变 | 做不到 | 部分 | 能——代价是一套发布流程 |
这张表上最常见的错误,是为了满足第一行的要求而买下第三行的代价。如果你真正拥有的是一条数据驻留条款,那么停在主权云是一个正当的答案,而且它保住了你当初据以构建的那个模型。
常见问题
自托管版 Bob 到底能不能跑前沿模型?
经由混合与私有 SaaS 配置,能——Claude Sonnet 5.0 与 Opus 4.8、Gemini 3.7 Flash 以及 GPT 5.6 Sol 就列在那里。但混合配置会把提示词发给一个外部服务,这回答的是数据驻留要求,而回答不了隔离要求。在正式可用时,受支持运行在客户自管基础设施上的模型是 Nemotron 与 Laguna。
这件事只发生在 IBM 身上吗?
不是。任何交付气隙版智能体产品的厂商都面对同一条约束——你只能运行客户可以持有的权重——所以「外壳可移植、模型档位改变」这个模式是结构性的,而不是 IBM 的某个选择。IBM 是个有用的案例,因为它的矩阵把这道劈分明说了出来,而不是留给你去推断。
我实际上会损失多少质量?
抽象地问是不可知的,而在你自己的场景里测很便宜:在拍板之前拿你的任务集跑一遍候选的本地模型,并比较每完成任务的成本,而不是比较一个基准分数。答案取决于具体工作负载;而对于界定清晰、测试良好的任务,它往往远小于榜单差距所暗示的。
我现有的评测套件还能用吗?
任务定义能。评判模型通常不能——一个托管的评判模型就是一项出口依赖,所以你要在内部重新托管一个更小的评判模型,并在你已有的标注集上重新校准它,因为换一个评判模型就是换一个指标。在基准真值可以按规则比较的地方,优先用规则,把这项依赖彻底去掉。
一个气隙项目会搞砸,最好的单一预测指标是什么?
在拍板之前,没有任何人在封掉对外访问的条件下跑过完整的任务集。那一个实验能在一个下午里让每一项隐式依赖现形,而省掉它,正是这类迁移总是被「撞见」而不是被「规划」的原因。
延伸阅读
本站相关:
- 气隙环境中的智能体部署——运维实操,包括导入节奏与验收闸。
- 提示词可移植性——为什么提示词是那件不会随之迁移的资产。
- 智能体的自托管推理——把你真能运行的那个模型服务起来。
- 数据驻留与主权——你的要求真正需要三种姿态中的哪一种。
- 智能体的出口管控——策略那一半,面向并非完全隔离的部署。
原始来源:
- IBM Bob expands to self-hosted environments——IBM 公告
- IBM allows on-prem deployment of its Bob agentic development platform——SiliconANGLE,2026 年 10 月 1 日