那次批准从未与动作绑定
人批准了一笔 40 美元的退款,运行时却执行了别的东西——没有注入、没有沙箱逃逸,只是批准被存成了挂在标识符上的一个布尔值,而参数仍然可写。Loopjacking 在 Agno 的七个版本上复现了它;样本里有一个 SDK 拒绝了它,而差别只是三行设计。
人批准了一笔 40 美元的退款,运行时却执行了别的东西——没有注入、没有沙箱逃逸,只是批准被存成了挂在标识符上的一个布尔值,而参数仍然可写。Loopjacking 在 Agno 的七个版本上复现了它;样本里有一个 SDK 拒绝了它,而差别只是三行设计。
OpenAI 在 9 月 10 日开放了 Agents API 公测,把那套托管的 Codex harness——会话、子智能体编排、恢复与上下文压缩——放到了一次 API 调用后面,除 token 与容器外不另收费。值得争论的是压缩这一步:它正是那个会悄悄改写"智能体到底在做什么"的变换,而如今它跑在一个你无法钉住、无法比对、也无法回滚的版本上。你采用它的那一刻,你的评测数字就不再描述一套你能控制的系统。
Flowise 在 2026 年 8 月 13 日把自己归档了,维护者点名了原因:如今编码智能体接手了那些复杂度,而僵硬的低代码工作流正是在那里撞墙的。还站着的三家也不是靠画布活下来的——每一家守的都是画布底下的某样东西,而每一份许可证都把那是什么写得清清楚楚。n8n 禁止你把它提供给别人,Dify 禁止多租户运营,Langflow 什么都不禁而它归 IBM 所有。先读条款,再读功能表。
四者都能让崩掉的运行从最后一个已完成步骤继续,所以那不是决策点。智能体的持久化记录是一份每一轮都在长大的对话记录,而不是几个小小的步骤结果——而这几个引擎的分歧在于:这份增长存在哪里、会撞上什么上限,以及你的模型调用允不允许待在会被重放的代码里。Temporal 会在第 51,201 个事件或 50 MB 历史处终止工作流;Inngest 把单步输出限制在 4 MB、单次运行状态限制在 32 MB;Restate 与 DBOS 则把这份增长推给你自己运维的存储。先按这个来定,再看计费形状,功能对照表就不重要了。
GEPA 报出的优势幅度——较 GRPO 最多 20%、较 MIPROv2 13%——全都测在自动检查器免费、且失败运行可以被用词句描述的场景上。这四个优化器里,两个靠一个裸标量就能跑,两个需要一句话。你的评测函数返回什么,决定了你能用上这个领域的哪一半;所以先改指标,再改优化器。
四家里有两家按每 vCPU 小时约九分钱计费那个智能体循环,两个价格相差 3.6%;另外两家干脆不为它收钱。它们真正在卖的,是一个存放对话的地方——而 AWS 在 2026 年 7 月 30 日把 Bedrock Agents Classic 对新客户关闭,是迄今最清楚的证据:托管运行时的哪一半你租得起。
框架对比总在争论图 vs 团队 vs 交接,但比喻到第三周就不再要紧。十八个月后你无法重选的,是一次运行住在哪里、崩溃后"恢复"意味着什么,以及人能不能把做了一半的任务暂停下来——照状态模型来选,对比的其余部分会自行解决。
每一个 AI 网关主打的都是同一个功能:自动故障转移到第二家厂商。那个功能并不是可用性上的胜利——它是一次只在事故期间才被触发的、未经测试的部署,而且落到一个你的评估从未覆盖过的模型上。真正该拿来做选择的是:谁来运维这一跳,因为那才是你没法便宜地反悔的决定。
朴素的智能体循环在 30 分钟作业的第 29 分钟死掉。持久化执行引擎会把每一步记录到日志,下一个进程就能从上次中断的位置接着干——而 2026 正是各家超大规模云厂商也下场推出自家产品的年份。四款引擎围绕同一个原语竞争,但架构与账单差得很远。
四款编排框架都能搭起同一个工作流,功能清单也几乎一致。真正决定谁能扛住生产环境的那一点却看不见:你的智能体状态究竟存在哪里。