这四家里有两家按每 vCPU 小时约九分钱为智能体循环计费,而两个价格相差 3.6%;另外两家干脆不为运行这个循环收钱。这本身就告诉你:循环不是产品。它们真正在卖的,是一个存放对话的地方——而 2026 年 7 月 30 日,AWS 把自己在这条赛道上的第一次尝试对新客户关闭了,这是目前能拿到的、关于"托管运行时的哪一半你租得起"的最清楚的证据。
一览
四个托管运行时,对"没人看着的时候,智能体的状态存在哪里"给出了四种不同的回答。
| 运行时 | 它按什么计费 | 对话状态存在哪里 | 什么时候该买它 |
|---|---|---|---|
| Amazon Bedrock AgentCore | Runtime 按 $0.0895/vCPU 小时与 $0.00945/GB 小时,Gateway、Memory 等各有独立计价。 | AgentCore Memory——是托管原语,但可以单独调用。 | 你希望各部件拆开卖,并且愿意自己组装。 |
| Microsoft Foundry Agent Service | 运行智能体本身不收费。你付的是模型 token、工具,以及按 GB 计的线程存储。 | Basic 配置下由微软托管;Standard 配置下是你自己的 Cosmos DB for NoSQL。 | 线程必须落在一个你已经拥有、也已经在审计的数据库里。 |
| Vertex AI Agent Engine | $0.0864/vCPU 小时与 $0.0090/GB 小时,另加每 1,000 条会话事件或记忆 $0.25。 | Sessions 与 Memory Bank——托管,也是四家里唯一按"写入"计费的。 | 你想要托管的记忆抽取,并愿意围绕"按条付费"来做设计。 |
| Cloudflare Agents | Workers 的运行时长与请求数;SQLite 存储自 2026 年 1 月 7 日起计费。 | 每个智能体实例一个 Durable Object,各自带一个内嵌的 SQLite 数据库。 | 你希望状态是一个可以按智能体查询的、真正的 SQL 数据库,且跑在边缘。 |
算力那一行是大宗商品,而所有人早就照这个定价了
AgentCore Runtime 按每 vCPU 小时 $0.0895、每 GB 小时 $0.00945 计费。Vertex AI Agent Engine 是 $0.0864 与 $0.0090。CPU 上差 3.6%,内存上差 5%——这正是一个商品无差异、且买卖双方都心知肚明的市场里该有的价差。Google 另外每月赠送 50 vCPU 小时与 100 GB 小时,那是一个营销决定,不是成本结构。
两家还共享同一个计费细节,而正是它让这场比价基本沦为学术讨论:CPU 只按活跃周期计费,你的进程阻塞在模型或工具调用上的那段挂钟时间并不计入。而智能体循环压倒性地就是在等 I/O。在真实的智能体负载上,算力表只在会话时长的一小部分里转动——这也是两家都不为这个费率开战的原因:里面根本没有值得开战的收入。
微软用"干脆不收"表达了同一个判断:创建与运行 Foundry 原生智能体没有单独收费,你付的是模型 token、工具与存储。Cloudflare 收的是 Workers 的时长与请求数,智能体本身没有专门的计费表。四家厂商,三种定价哲学,却指向同一个结论——跑那个循环不是钱之所在,因此也不是差异化之所在。
谁持有那条线程
这些运行时每一个都能拆成大致相同的五样东西:一处执行你代码的地方、一个决定下一步调什么的循环、一个够得到工具的网关、一个决定调用以谁的凭据出发的身份代理,以及一个记住发生过什么的存储。前四样在真正要紧的意义上都是可移植的——你可以重写它们;而如果你当初是对着一个框架、而不是对着厂商的循环写的智能体,你几乎不用重写。第五样不可移植,因为它不是代码。它是带着厂商特有结构的累积数据,而部署跑得越久,它就越多。
这里才是四家真正分道扬镳的地方。微软的 Standard 配置把线程消息与对话历史放进一个属于你的 Azure Cosmos DB for NoSQL 账户——这是与此处其他任何选项都不同的一种主张:退出是一次你可以规划的数据迁移,从一个你本来就能查询的数据库里迁出,而不是一张导出申请单。Cloudflare 的答案在结构上相似、在哲学上不同——每个智能体实例都是一个持有自己 SQLite 数据库的 Durable Object,所以状态是你能读的真 SQL,但对象的生命周期与放置权在 Cloudflare 手里,而且 Workers 平台之外没有任何东西是这个形状。
AWS 与 Google 都把对话状态留在一个托管服务里。AgentCore Memory 至少是一个可独立调用的原语,而不是焊死在循环上的东西。Google 的 Sessions 与 Memory Bank 则朝另一个方向走得更远:Memory Bank 替你做抽取——判断一次会话里哪些事实值得留下——并按每 1,000 条已存事件或记忆 $0.25 计费,而存下的字节还会作为 Agent Storage 以每 GiB 月 $0.30 再计一次。请留意"按写入计费"会对设计做什么。在 Vertex 上,你有一个长期存在的、少写记忆的财务动机;这个动机本身是合理的,但它同时是厂商特有的,并且会悄悄塑造你的记忆策略。
AWS 的第一次尝试究竟证明了什么
Amazon Bedrock Agents 在 2023 年 11 月上线时就是一个以配置定义的托管循环:声明一个模型、若干 action group 与一组指令,AWS 负责跑。到 2026 年 7 月 30 日,它变成了 Bedrock Agents Classic,对新客户关闭并进入维护模式。既有负载继续运行,不再有新功能,模型目录冻结在进入维护模式的那一天。最后这一条才是值得盯着看的部分——模型目录冻结意味着这次弃用不是一次可以拖到停服通知到来前都不管的表面改名。它是一次缓慢的到期,而它开始的那一刻,是你想用的某个模型成了这个服务永远不会提供的模型。
顺理成章的解读是"以配置定义的智能体失败了"。这个解读是错的,因为 AWS 又发了一个:AgentCore Harness 于 2026 年 6 月 17 日正式可用,卖的是同一套说辞——声明模型、工具、技能与指令,由 AWS 装配并运行那个循环,替你管理上下文、隔离会话、从失败中恢复。
变的不是循环。变的是循环如今只是那些"你也可以直接使用"的原语的一个可选消费者。AgentCore 把 Runtime、Gateway、Memory、Identity、Observability、Policy、Evaluations、Browser 与 Code Interpreter 作为可分别使用、分别计费的服务出售。而 Bedrock Agents Classic 卖的是一个捆绑包,循环、状态与模型目录是同一笔采购,所以冻住其中任何一个就冻住了全部。这才是真正的教训,而且它能推广到 AWS 之外:
当一家厂商提出替你跑智能体循环时,问一句:如果这个循环产品明天被冻结,你手里还剩什么?如果诚实的答案是"什么都不剩",那你买到的不是一个运行时——你买到的是一个"生命周期终点就是你的迁移日"的产品。
把这个测试套到四家身上,排序会很干净。在 AgentCore 上,你手里还会剩下记忆存储、网关与身份代理,每一个都能单独调用。在启用 Standard 配置的 Foundry Agent Service 上,你手里还会剩下你的 Cosmos DB,因为它从来就不是他们的。在 Cloudflare 上,你手里还会剩下 Durable Objects,它早于 Agents SDK 存在,而且并不是一个智能体产品。在 Vertex 上,你手里还会剩下 Sessions 与 Memory Bank,它们是分别计费的服务——但决定什么进得去的那套抽取策略,是 Google 的。
什么情况选哪个
| 情况 | 选 | 因为 |
|---|---|---|
| 对话历史是受监管数据,而审计方对它已有既定流程 | Microsoft Foundry Agent Service,Standard 配置 | 把线程存进你自己的 Cosmos DB,是这里唯一一个"状态从一开始就不在别人边界内"的选项。 |
| 你要托管的部件,但拒绝一个捆绑的循环 | Bedrock AgentCore,只用原语 | Runtime、Gateway、Memory 与 Identity 都能独立调用,于是你可以拿走底座、自己写循环。 |
| 长期存活的按用户智能体,单会话成本低,且延迟要紧 | Cloudflare Agents | 一个智能体一个 Durable Object,各带 SQLite,回合之间进入休眠——状态能活下来,而路径上不需要一个会话服务。 |
| 你希望记忆抽取是一个买来的托管服务,而不是一件自己造的东西 | Vertex AI Agent Engine | Memory Bank 替你决定跨会话什么值得记住。为它做预算:每 1,000 条事件 $0.25,单条便宜,整个部署没有上限。 |
| 你在做原型,并预期一年后人已经不在这儿了 | 四个都行,但有一个条件 | 对着框架写智能体,而不是对着厂商的循环写,并为线程存储保留一条导出路径。这两件事现在都很便宜,而且事后都补不回来。 |
真正约束你的那个选择,比这场对比暗示的要窄。算力是大宗商品,循环可替换,网关是配置。请按"对话住在哪里"、按"产品死了原语还在不在"来选——并且,既然你如今手上已经有了一个"某家超大规模云在不到三年里把恰好这类服务收掉"的实例,那就也按"这家厂商上一次改主意时的表现"来选。
常见问题
Bedrock Agents Classic 已经停服了吗?
没有。它在 2026 年 7 月 30 日对新客户关闭并进入维护模式。既有负载继续运行,但不再新增功能,模型目录冻结在进入维护模式的那一天——所以真正的期限,是你需要某个它永远不会提供的模型的那一天。
四家里哪家最便宜?
这个问题一碰到账单就活不下来,因为它们计费的东西根本不同。在存在算力费率的地方,AgentCore 与 Vertex 每 vCPU 小时相差 3.6%,且两家都只按活跃 CPU 计费,而非阻塞在模型调用上的时间。Foundry 对智能体运行时不收费,Cloudflare 把它折进了 Workers。无论哪一家,占大头的那一行都是模型 token,而增长最快的那一行是状态。
我能把对话状态放进自己的数据库吗?
在 Microsoft Foundry Agent Service 上可以——Standard 配置支持在 Azure Cosmos DB for NoSQL 账户上自带线程存储。在 Cloudflare 上,状态是 Durable Object 内一个按智能体划分的 SQLite 数据库,归你查询,但活在他们的平台上。在 AgentCore 与 Vertex AI Agent Engine 上,对话存储是托管服务——所以请在攒下一整年线程之前,先把导出问清楚。
以配置定义的智能体是不是比写代码更容易锁死我?
单靠这一点并不会。Bedrock Agents Classic 之所以锁住了人,是因为循环、状态与模型目录是同一笔采购,所以它冻结时什么都没剩下。AgentCore Harness 同样以配置定义,却坐在一组可分别调用的原语之上——同样的界面,截然不同的出口。
这和挑一个智能体框架是同一件事吗?
不是。框架决定你怎么表达那个循环;托管运行时决定谁来运维它、谁持有会话。两者正交,而经久有效的建议是:买运行时,而对着框架写循环——这样能搬走的那一层,正好是承载你逻辑的那一层。
签约前我该基准测什么?
不是吞吐。去量一次典型会话在一个月里累积多少状态,再按厂商的存储与按条费率给它标价,然后问一句:把它导出来长什么样。这三个数字比你在试用期里能收集到的任何延迟数据都更能定案。
延伸阅读
本站相关:
- 托管智能体运行时——五个原语,以及为何捆绑才是锁定。
- 退出一个托管智能体运行时——真要走的时候,按什么顺序把东西取出来。
- 模型弃用与迁移——低一层的同一个问题。
- 记忆写入路径架构——Memory Bank 在替你做什么,自己做又要付什么代价。
- 持久化执行:LangGraph + Temporal——四家之外的自运维方案。
- LangGraph vs CrewAI vs OpenAI Agents SDK vs Google ADK——跑在这些之上的框架层。