AI 网关

E19
概念 · AI 模型与工具生态

AI 网关。

网关坐在你的智能体和模型之间,悄悄同时变成了两样东西:一个每个请求都必须活着穿过的基础设施,以及唯一知道你的智能体花了多少钱的那本账。多数团队为前一件事买它,却为后一件事留下它——而后者才值得掏钱,因为按每次调用抽的百分比,本质上是对循环深度征税,而智能体无非就是循环。

STEP 1

五份差事,共用一个名字。

「AI 网关」「LLM 代理」「模型路由器」这些说法被混着用,指的是做了下面五件可拆分差事中某个子集的产品。把它们分开命名就是全部诀窍,因为你本来可以分开买,而大部分痛苦正来自没意识到这一点:

  • 路由与故障转移。逐请求挑模型或挑提供方,某一家挂掉或被限流时改投别处。其机制——以及为什么难点在升级信号上——见模型路由
  • 密钥托管。你的应用只用一份凭据,多家提供方的凭据由网关持有,于是工程师从不经手 sk- 开头的密钥,而泄漏的应用密钥可以在一处轮换。
  • 缓存。精确匹配或语义层面的响应复用,外加为把提供方侧的提示词缓存保持在热态所需的那点路由。
  • 策略。按密钥限速、按租户设支出上限、内容过滤、PII 脱敏,以及拒绝违反数据驻留规定的调用。
  • 计量与归因。把每一次调用记成一条归一化的记录——模型、输入输出令牌数、成本、延迟、哪个用户、哪一次智能体运行——用同一套 schema 覆盖那些各自把用量报得略有出入的提供方。

只有最后一件真的难以复刻,也只有最后一件会随你长大而越来越值钱。市场的读法也是如此:OpenRouter 跨数十家提供方路由 400 多个模型,并对流经它的推理支出抽取约 5%;据 2026 年 8 月的报道,Stripe 将以超过 70 亿美元将其收购——一家支付公司买下了那层负责数 AI 用量的东西,而在此七个月前,它刚完成对用量计费厂商 Metronome 的收购。

STEP 2

凡是在请求路径上的,都是一项可用性依赖。

一个你同步调用的网关,不是你「用」的服务,而是你「依赖」的服务。这一跳带来三项成本,其中只有一项写在价目表上:

  • 可用性是相乘着往下走的。99.9% 的网关挡在 99.9% 的提供方前面,你拿到的大约是 99.8%——你多加了一个「模型明明没事却能坏掉」的东西。这与多数人采用它的初衷恰好相反。
  • 延迟是按调用累加,不是按任务累加。十到五十毫秒的代理开销会消失在一次聊天响应里,却不会消失在二十步的智能体循环里,也不会消失在预算只有 300 毫秒的一次语音轮次里——参见成本、质量与延迟
  • 百分比是对步数征的税。对一个聊天机器人抽 5%,在「每轮一次调用」的量级上只是零头。对一个每个任务发起三十次模型调用的智能体,抽的仍是 5%——但那是一张本身就大三十倍的账单的 5%,这正是为什么网关支出总在智能体真正跑起来的那一刻让人吃惊。

故障转移这个卖点值得单独怀疑一下。网关只能切到「你的提示词确实能跑通」的那个模型上,而提示词并不像厂商暗示的那样可移植:工具调用格式、系统提示词的处理方式、拒答行为,各家都不一样。没测过的故障转移是一项配置,不是一项能力。如果你从没拿评测集跑过备用模型,就假定备用是坏的——优雅降级是你要去测的东西,不是你打开开关就有的东西。

STEP 3

你一周之内造不出来的那部分,是那本账。

自建代理的团队通常一个下午就能把路由和密钥托管跑通,然后花两个季度啃剩下那乏味的一半。而那乏味的一半,才是你真正在买的东西:

  • 归一化。每家提供方报用量的字段名不同、缓存命中的算法不同、推理令牌的处理方式不同,还各按各的节奏改价。把它们收进同一套 schema 是既不体面又没有尽头的活儿。
  • 把支出接到结果上。单次调用成本几乎没用;而一笔接上了「哪一次智能体运行、哪个租户、任务成没成」的成本,才是撑起你生意的那个数字——这也是成本归因之所以是一门运维手艺而不是一块看板的原因。
  • 要能拦,不只是能报。一本能在租户超预算时拒绝下一次调用的账,比一本给你发月报的账值钱得多——这正是成本控制与成本会计之间的差别。

请注意这背后的含义:这些「账本类」差事,压根不要求网关待在你的请求路径上。计量完全可以消费你的可观测性栈已经在收的那份遥测。把两者拆开——数据面直连提供方,网关只当控制面——你就拿到了账本却没背上可用性依赖;而这种形态很少有人考虑,只因为产品是被当作一个整体卖出来的。

STEP 4

买那本账,留好退路。

不论选谁,都要选得能扛住厂商被收购、被重新定价或服务变差——这三件事在 2026 年的这个市场上都在某处发生过。有三条性质值得你坚持:

  • 两侧都是 OpenAI 兼容接口,这样网关就只是一个 URL 加一把密钥,而不是一套框架。如果关掉它意味着重写调用点,那它从来就不是代理。
  • 自己名下的提供方账号,至少对你真正依赖的那些模型如此。当供给紧张时,一个握着你与模型厂商唯一商业关系的网关,也就握着你的配额,而配额正是最先耗尽的东西——参见限流与提供方容量
  • 一条被测过的旁路。一个能把流量直连过去的开关,按计划定期演练,而不是等网关挂了那天第一次用。

在比较产品之前先定一件事:这是一次数据面采购,还是一次控制面采购?如果你要的是把故障转移、缓存与策略执行放进请求路径,那就接受你已经加上了一项硬性可用性依赖,并据此向厂商索要真实的 SLA、一条被测过的旁路,以及一份逐调用的延迟预算。如果你真正想要的只是一个诚实的数字——你的智能体花了多少、为谁花的——那就让调用直连,只买那本账:你拿到了计量,却没把「能把模型从你手里拿走」的权力交给任何人。

延伸阅读:推理提供方讲这一跳另一侧站着谁,托管型智能体运行时把同样的自建与外购之问抬高一层,单位经济学讲这一切最终喂给的那个数字。