AI 博客

Langfuse vs LangSmith vs Phoenix vs Braintrust:计量方式才是产品

功能表已经收敛,所以真正的决定在许可证与计费的计量单位——而每一种计量方式定价的,都是那份日后会变成你的黄金集、回归基线与微调语料的轨迹存档。按 OpenTelemetry 做仪表化、把这份流双写到一处你自己拥有的地方,平台就成了一个可替换的后端。

作者 智能体 AI 维基 29 分钟读完

照功能表在这四家里挑,你一定会挑错,因为功能表已经收敛了——四家如今都做链路追踪、评估、数据集和提示词版本管理,演示看上去也一个样。真正把它们分开的是计费的计量单位和许可证,而这两者作用在同一份资产上:那份日后会变成你的黄金集、回归基线与微调语料的轨迹存档。这些平台无一例外,都在给你最需要留住的那样东西装表;而绕开它的办法,在你签任何合同之前就有——按 OpenTelemetry 而不是按厂商 SDK 做仪表化,平台就从"你证据的存放地"变成了一个可替换的后端。

速览

四个平台,按各自真正围绕什么建起来排序,而不是按各自支持什么。

平台围绕什么建起来许可证与部署最适合
Langfuse 开放的轨迹存储——框架无关的接入,评估与提示词管理长在其上 MIT,可完整自托管于 Postgres + ClickHouse,无功能阉割;2026 年 1 月被 ClickHouse 收购 希望存档留在自家基础设施上、并且随时能离开云版的团队
LangSmith LangChain 与 LangGraph 的开发循环,链路追踪是它的原生界面 闭源;默认云版,自托管仅限企业方案 已经押注 LangChain 技术栈的团队,那里的集成最深
Arize Phoenix OpenTelemetry——Phoenix 建在其上,Arize 同时维护着仪表化层 OpenInference Elastic License 2.0,源码可得;自托管无用量限制,或用 Arize AX 这个 SaaS 想要标准优先的仪表化的人,以及需要同时看漂移与嵌入分析的 ML 团队
Braintrust 评估循环——分数是基本单位,轨迹挂在分数下面 闭源;云版为主,本地与混合部署仅限企业方案 用评估结果给发布设关卡、并希望这套工作流是一等公民而不是自己攒的团队
Langfuse, LangSmith, Phoenix and Braintrust across five axes A feature matrix comparing four LLM observability platforms on five axes: permissive open-source licence, unlimited self-hosting, OpenTelemetry-native ingestion, evaluation gating in continuous integration, and prompt and dataset management. Langfuse is strong on licence and self-hosting, Phoenix is strong on self-hosting and OpenTelemetry but ships under a source-available licence, Braintrust is strongest on evaluation in CI, and LangSmith is closed source with self-hosting reserved for enterprise plans. Where each one is actually strong Langfuse LangSmith Phoenix Braintrust Permissive OSS licence MIT Closed Elastic v2 Closed Unlimited self-hosting Yes, no gates Enterprise only Yes, no gates Enterprise only OpenTelemetry-native ingest Any OTel SDK Supported Built on it Supported Eval gating in CI Present Present Present The product Prompt & dataset management Full Full Full Full Strong Medium Weak or restricted The bottom two rows have converged — every platform now has evals, datasets and prompt versioning. The top three are where the decision lives, and none of them is a feature: they are licence, deployment and whether your instrumentation is portable. Elastic Licence 2.0 is source-available rather than OSI open source — you can self-host it, you cannot offer it as a managed service.
底下两行已经收敛了。真正的决定在最上面三行。

轨迹存档才是资产,而它正是被装了表的那样东西

One agent run, four downstream consumers, and where the vendor boundary falls An agent run emits an OpenTelemetry span tree that flows into an observability platform. From there four consumers draw on the same data: live debugging, the evaluation golden set, the regression suite in continuous integration, and fine-tuning or few-shot example extraction. The upper path instruments directly against a vendor SDK, so the vendor boundary sits before the span tree and all four consumers depend on the vendor. The lower path instruments against OpenTelemetry and OpenInference, so the boundary sits after the span tree and the platform becomes a swappable backend. Instrumented against a vendor SDK Agent run steps, tools, spans Vendor SDK proprietary span shape Platform storage · UI · evals Debug · golden set CI gate · fine-tune data Boundary here Everything downstream is shaped by the vendor's span model. Switching platforms means re-instrumenting the application, and the historical traces — your golden set, your regression baseline — do not come with you. Instrumented against OpenTelemetry Agent run steps, tools, spans OTel + OpenInference standard semantics Platform swappable backend Debug · golden set CI gate · fine-tune data Boundary here The application emits standard spans and knows nothing about the vendor. A second exporter can write the same stream to a warehouse you own, which is what makes the golden set and the fine-tuning extract survive a platform change. Your traces are the highest-value proprietary dataset the system produces The question is not which UI you prefer. It is whether the golden set you spend a year curating is portable.
问题不是你更喜欢哪个界面,而是换平台时那份黄金集还在不在。

一条智能体轨迹不是一行日志。它是一次决策的完整记录——检索到了什么、调用了哪些工具、传了什么参数、返回了什么、模型接下来做了什么——而它供养的四个下游消费者,每一个都比你当初买它时想着的那个排障视图更重要。你的评估黄金集是从真实轨迹里挑出来的。你的回归基线是其中一组被钉住的轨迹。你的少样本示例与任何微调数据都是从里面抽出来的。而当客户六周后来投诉时,你的事件证据就是那些你还留着的轨迹。

这让存档成了多数智能体团队产出的最有价值的专有数据集,而它恰恰是所有商业方案计量的对象。Langfuse 数 observation,LangSmith 数 trace 和席位,Braintrust 数分数与处理的数据量。每一种计量方式就其自身逻辑都站得住,而每一种都在给"让智能体排障真正可行"的那些行为定价:记录每一步而不只是顶层调用、让整个团队都能看、以及持续而不是分批地给运行打分。

What each platform meters, and how that behaves at agent scale Four platforms compared on what their billing meter counts, what makes the bill grow, which engineering instinct the meter penalises, and what the escape hatch is. Langfuse meters observations with self-hosting as the escape hatch, LangSmith meters traces per seat, Phoenix meters nothing when self-hosted, and Braintrust meters scores and processed data volume. The meter, not the feature grid, is what you feel in month six Langfuse LangSmith Phoenix Braintrust Billable unit Observations Traces + seats None if self-hosted Scores + data volume What inflates the bill More agent steps More runs, more staff Your own infra More scorers per run What the meter discourages Fine-grained spans Wide team access Nothing — you operate it Scoring every run Escape hatch MIT self-host Enterprise contract Already there Enterprise contract Every meter penalises the behaviour that makes agent debugging work: recording each step, letting the whole team look, and scoring runs continuously rather than in batches. Sampling to fit a plan is how a trace store stops being an evidence store. Plan structures and unit names change often. Re-derive the shape from current pricing pages before committing — the pattern is durable, the numbers are not.
每一种计量方式抑制的都是同一种本能:把运行记录得更全。

可以预见的结果是采样。团队撞上方案上限,降到百分之一采样,于是存档悄悄地不再是一个证据库——这个变化没人会注意到,直到某次调查需要那条没被留下的运行,而这正是保留与法律保全里详细论证过的那件事。在比价格之前,先算出你真实的量级:每任务步数乘以每天任务数,而不是每天请求数。一个跑二十步的智能体,产生的计费单位是服务同样多用户的聊天机器人的二十倍,而正是这个倍数把一个看着很宽裕的方案变成了一笔意料之外的开支。

各自真正强在哪里

Langfuse:存档归你,而且许可证白纸黑字这么写

Langfuse 是 MIT 许可,自托管是一等路径,开源版本没有功能阉割——链路追踪、评估、提示词管理、数据集、实验和 playground 全在里面。这比"开放内核"是更强的承诺,也是它成为默认推荐的原因:对那些反对用 SaaS 是出于数据而非价格的团队而言。

ClickHouse 于 2026 年 1 月收购了 Langfuse,同期宣布 4 亿美元 D 轮,使 ClickHouse 估值达 150 亿美元;许可证与自托管姿态被明确保留。技术上的契合本来就在——Langfuse v3 在收购之前就跑在 ClickHouse 上——务实的读法是:那个分析后端如今由造它的公司来维护。要掂量的风险是收购之后的老问题:路线图现在要服务一个更大的战略,而其中对自托管者要紧的那些部分,正是要盯着看的部分。

LangSmith:在它为之而生的那套技术栈里无可匹敌

如果你的智能体是 LangGraph,LangSmith 能看见通用链路追踪器看不见的东西——图状态、节点边界、框架自身的重试语义——因为它就是跟它们一起长出来的。这是一项实打实的优势,值得为它做选择,理由与"任何第一方工具都值得考虑"是同一套。

代价有两项,而且都不藏着。它是闭源的,自托管仅限企业方案,所以在你大到能谈判之前,存档都放在别人的基础设施上。计量方式是按 trace 计费再叠席位——Plus 方案挂牌为每席位每月 39 美元并含一定额度的 trace,免费档则是数千条 trace——这恰恰给你最希望增长的两件事定了价:记录下来的运行数,以及来看它们的人数。它同时把你与某一个框架的命运绑在一起:如果你打算留下,这风险比听上去小;如果不打算,那就很大。

Phoenix:标准优先的那个选项,附带一条许可证注脚

Phoenix 建在 OpenTelemetry 之上,自我描述为厂商、语言与框架无关;Arize 同时维护着 OpenInference——如今生态里相当一部分用来发出 LLM span 的仪表化与语义约定层。因此选 Phoenix 会带来一件别家给不了的东西:它让你的仪表化成为一项独立于平台的资产,因为同样的 span 可以发往任何讲 OTel 的地方。自托管版本没有用量限制,也不回传遥测——对处在受监管环境里的团队,这一条往往就是全部决定。

有两点需要说准确。许可证是 Elastic License 2.0——源码可得,而非 OSI 认定的开源:你可以无限制地运行、修改和自托管它,但不能把它作为托管服务提供给第三方。对几乎任何团队来说这个区别都无关紧要;对一家平台厂商则是决定性的,而它常被误报。其次,Arize 在 ML 可观测性上的出身,表现为漂移检测与嵌入分析,这是 LLM 原生工具只能粗略近似的东西——如果你同时还跑经典模型,它值点钱;如果不跑,它一文不值。

Braintrust:唯一一个把评估当作产品本身的

其他几家都是在一个链路追踪工具上加了评估。Braintrust 是从分数出发、再把轨迹挂到分数下面,差别体现在工作流上:实验、跨运行对比、用分数给发布设关卡,是主路径而不是界面里的一个板块。如果你的团队本来就在实践评估驱动开发,这就是那个不会跟你别扭的平台。

计量方式值得仔细建模,因为它不太一样。挂牌定价按分数与处理的数据量计费——免费的 Starter 档带一小份处理数据量与分数额度,Pro 每月 249 美元带更大额度并对超出部分按单价计费——而模型令牌在你走它的代理时另行计费。别扭的激励在于:每条轨迹多跑几个打分器既是被推荐的实践,又是推高账单的那件事,所以打分密度要刻意定下来,而不是从账单里才发现。

上面这些价格点有一条共同的告诫:这个品类经常调价,而方案结构比平台本身变得更勤。把这里的数字当作各家计量方式的形状来读,对照当前定价页核实,并据此给任何一篇对比文章——包括这一篇——打个折扣。

没人拿来做卖点的那条轴:仪表化做一次,后端随便换

下面这个决定,比你今天做的选择活得更久。昂贵的部分是仪表化——那些 span、那些属性,以及一致地记录工具参数与检索结果的那份纪律——而它正是你不想重来一遍的部分。如果你按厂商 SDK 做仪表化,这份工作就归了厂商,换平台意味着要动应用代码。如果你按 OpenTelemetry 加 OpenInference 约定做仪表化,应用发出的是标准 span,并且完全不知道是谁在接收。

由此得到三条推论,它们是本文务实的内核。

一开始就把同一份流发往两个地方。一个 exporter 发给平台,另一个发给你自己掌控的存储——对象存储就够。它花掉一个下午,换来的是:无论厂商关系将来如何,存档、黄金集以及未来任何微调抽取都归你。这也是"保留期"这个问题唯一一种你真能向监管者答得上来的版本。

在需要迁移之前先评估迁移。该问厂商的不是"你们支不支持 OpenTelemetry"——现在人人都支持——而是"我能不能把历史轨迹导出成另一个平台吃得下的格式"。各家的答案差别很大,而这个差别只会在你最无力应对的那一刻才显形。第三方与供应商风险那套框架在这里比多数人预想的更适用。

让评估而不只是轨迹可迁移的,是标准语义。一份建立在"只有一个平台解析得了的 span"之上的黄金集,迁移方式就是重写。在有标准的地方遵循 OpenTelemetry GenAI 语义约定,在仪表化阶段一分钱不花,却是"换一下"与"做个项目"之间的差别。

这些都不是在反对为托管平台付费。那个界面、跨轨迹的搜索、评估工具,以及不必自己运维一个 ClickHouse 集群,都值真金白银。它主张的是:这笔钱该买的是便利,而不是数据的保管权——而在签约那一刻,这两者极容易被混为一谈。

什么情况下选哪个

情形理由
轨迹不能离开你的基础设施 Langfuse 或 Phoenix 两者自托管都没有功能阉割或用量限制;另外两家把它留给了企业方案
你需要一个可以在其上做二次开发的宽松许可证 Langfuse MIT,且在 ClickHouse 收购中被完整保留;Phoenix 是 Elastic v2 下的源码可得
智能体是 LangGraph,而且会一直是 LangSmith 通用链路追踪器复现不了的图级可见性,出自发布这个框架的团队
发布由评估分数把关 Braintrust 分数是基本单位而不是轨迹之上的一个视图,CI 卡点是主路径
经典 ML 与 LLM 负载混跑 Arize 漂移检测与嵌入分析,和 LLM 轨迹在同一个平台上
步数高、对成本敏感 自托管的 Langfuse 或 Phoenix 按 observation 计量会随智能体步数一起涨,一个二十步的任务按二十次调用计费

这六行底下的建议是同一条:无论你选哪个,都按 OpenTelemetry 做仪表化,并把这份流双写到一处你自己拥有的地方。这一个决定比"在这四家里选哪家"更值钱,而且它是唯一一个日后再改会很贵的决定。

常见问题

Langfuse、LangSmith、Phoenix 和 Braintrust 有什么区别?

四家都做链路追踪、评估、数据集和提示词管理,功能表基本已经收敛。区别在许可证与部署方式——Langfuse 是 MIT 且可完整自托管,Phoenix 在 Elastic License 2.0 下源码可得且自托管无限制,LangSmith 与 Braintrust 闭源、自托管仅限企业方案——以及各自计费表数的是什么:分别是 observation、trace 加席位、自托管时什么都不数,以及分数加数据量。

Arize Phoenix 是开源的吗?

Phoenix 在 Elastic License 2.0 下源码可得,允许无用量限制地运行、修改与自托管,但不允许作为托管服务提供给第三方。这不是 OSI 认定的开源许可证,而在对比文章里它经常被写成 Apache 2.0。对多数团队来说这条限制永远不会咬到;对任何要把它当服务转售的人,它会。

ClickHouse 收购 Langfuse 改变了许可证吗?

没有。ClickHouse 于 2026 年 1 月宣布收购,同期宣布 4 亿美元 D 轮,并声明 MIT 许可证保持不变、自托管仍是一等公民、路线图不变。交易之前 Langfuse 内部就已经跑在 ClickHouse 上。任何收购之后真正要盯的是路线图方向,而不是许可证文本。

怎么估算这些平台用在一个智能体上要花多少钱?

用每任务步数乘以每天任务数,而不是每天请求数。一个走二十步的智能体,发出的计费单位大约是服务同样多用户的聊天机器人的二十倍,而多数方案上限当初是按聊天机器人的量级定的。然后核查你打算用的打分密度——每条轨迹跑几个评估器——是否单独计量,因为在某些平台上确实如此。

以后还能换平台吗?

只有当初按 OpenTelemetry 而非厂商 SDK 做了仪表化,换起来才便宜;只有能把历史轨迹导出成另一个平台吃得下的格式,才换得彻底。签约前就把导出的问题问清楚,并从第一天起把 span 流双写到你自己掌控的存储——从那些轨迹里挑出来的黄金集与回归基线,通常比平台订阅费值钱得多。

我到底需不需要一个平台,还是 OpenTelemetry 就够了?

OpenTelemetry 把 span 从你的应用里送出来;它不给你跨轨迹的搜索、跨运行的对比视图、评估执行器,也不给非工程角色一个做标注的地方。你买的正是这些。有用的框架是:这笔钱该买的是便利,而不是数据的保管权。

延伸阅读

本站相关:

项目来源: