这几家里,有一家一千次搜索卖你一美元,另一家要收十六美元,而两个价格都很诚实——它们卖的本来就是不同分量的活儿。一个搜索 API 用什么单位计价,恰好说明了它在检索流水线上读到哪一步为止;而它没做完的每一段,你的智能体照样要付账,只是付在抓取失败、延迟和 token 上。请给整个回合计价,而不是给一次调用计价——这么一算,价目表上最便宜的那个 API,反而成了你能挑到的最贵的一个。
一览
四个智能体开发者真正会去用的 API,价格取自 2026 年 8 月公布的价目表。先读第三列——决定你账单的是它。
| API | 基础价目 | 一个计价单位包含什么 | 它读到哪儿为止 |
|---|---|---|---|
| Brave Search API | 每 1,000 次调用 5 美元,各网页搜索端点统一价 | 来自 Brave 自有索引的排序结果;另有一个 LLM Context 端点,以同样的价目返回抽取好的"smart chunks" | 片段——若改调另一个端点,则读到完整抽取 |
| Exa | 每 1,000 次搜索 7 美元(≤10 条结果) | 神经检索与关键词检索,自 2026 年 3 月的定价调整起,前十条结果的页面正文已含在价内;第十条之后每 1,000 条加收 1 美元 | 抽取好的正文,就在基础调用里 |
| Tavily | 按积分计——即用即付每分 0.008 美元,走量可降到 0.005 | 一次 basic 搜索花 1 分、返回片段;一次 advanced 搜索花 2 分,会去抓取页面并抽出干净正文 |
取决于你把 search_depth 设在哪儿 |
| Parallel | 基础请求 0.001 美元返回十条结果,每多一条结果与摘录再加 0.001 | 带摘录的结果;另有一个 Task API,把一整份研究作业跑完,每 1,000 次起价 300 美元 | 摘录——研究循环是另一个产品 |
还有两个数字框定了这个市场。2026 年 8 月一份针对八个智能体搜索 API 的独立评测里,Brave 在答案质量上以微弱优势居首,Exa、Firecrawl 与 Parallel 的 Pro 档紧随其后、差距近到可能只是噪声,而 Brave 领先 Tavily 约一分。同一份评测测到延迟有 20 倍的跨度:快的一端约 670 毫秒,慢的一端 13.6 秒。请记住第二个数字;它造成的伤害,大于第一个数字带来的好处。
四种计价单位,四个不同的产品
计价单位就是一份设计文档。它告诉你厂商认为自己在卖什么;而通过它没说的部分,也告诉你厂商指望你自己去建什么。
Brave:一次调用一口价,外加一个把整笔账重算的第二端点
Brave 按搜索引擎的方式定价,因为它本来就是一个——自有抓取与索引、每千次调用 5 美元一口价、没有按结果数算的算术。这份"平"比看上去值钱:四家里只有它能让你不用打开表格,就从这个月的请求数推出下个月的账单。2026 年 2 月免费额度被取消、改为每月 5 美元赠金,惹恼了不少业余项目,但没有改变任何结构性的东西。
有意思的是那个 LLM Context 端点:它跑一次查询、打开排名靠前的页面,把清洗过的分块返回给你——正文、JSON-LD 结构化数据、代码块、论坛帖、视频字幕——价格同样是每千次 5 美元。同一个价钱,两个产品,分踞那条要紧的线的两侧。多数评测把 Brave 归为"便宜的片段选项";而这只对人们碰巧先接上的那个端点成立。
Exa:正文本身就是产品,而且基础调用里已经带上了
Exa 按搜索次数计价,并把前十条结果的页面正文折进那 7 美元里。2026 年 3 月之前正文是单独计费的,而这次改动不只是一次打折——它把 Exa 的默认形态从"一个你之后还要去读的搜索 API"挪成了"一个直接把正文递给你的检索 API"。超过十条之后,每多一条按每千条 1 美元计,于是成本跟着"你撒网有多宽"走,而不是跟着"你发了多少次查询"走;对一个宁可跑一次宽搜索、也不跑五次窄搜索的智能体来说,这正是对的形状。
再往上是每千次 12 美元的 Deep Search 与 15 美元的深度推理搜索、5 美元的 Answer 端点,以及给常驻查询用的、每千次 15 美元的 Monitors。这套分档对"多读一些要花多少钱"是诚实的;而它也正是为什么,一个建立在"搜索端点是 7 美元"之上的天真成本模型,会低估一个在循环里悄悄调用 Answer 的系统。
Tavily:按积分,因为工作量本来就确实在变
Tavily 是唯一把"深度开关"显式定价的那一家。一次 basic 搜索 1 分;一次 advanced 搜索 2 分,而多出的那一分买的是"抓取加抽取"这一遍——API 会打开页面、返回干净正文而不是片段。按即用即付每分 0.008 美元算,分别是每千次 8 美元与 16 美元,走量套餐可降到 0.005;免费额度是每月 1,000 分,付费套餐从 30 美元 4,000 分起。
积分模型很诚实,同时也是四家里最不可预测的一个,因为单次 Research 调用可能消耗 4 到 250 分不等,取决于它走多深。由人来触发时,这没问题。放进一个自主循环里就是另一回事了——因为决定钻多深的那个东西,和花钱的那个东西是同一个。这类隐患的一般形态在成本归因与预算里。
Parallel:按结果与摘录计,研究循环单独卖
Parallel 的搜索定价是一条公式而不是一个数字:基础请求 0.001 美元返回十条结果,每多一条结果与摘录加 0.001,advanced 模式起步 0.005。在最小配置下,这就是每千次请求 1 美元——本次比较里最便宜的标价,比第二名还便宜五倍。
这条公式本身就是线索。Parallel 收的是"它递给你多少文字"的钱,说明它想过本文通篇在讲的这件事——而它也把贵的那一半拆出去做成了 Task API:一次深度研究运行每千次起价 300 美元,最重的档位涨到 2,400 美元。这两个产品分踞同一条线的两侧,价格相差 300 倍;关于"搜索调用里到底装了多少活儿",这是一句相当精确的陈述。
给回合计价,而不是给调用计价
下面这笔账会把排名重新洗一遍。取一个普通的研究回合:智能体发出三次搜索,最后读了十二个页面。假定一个页面剥掉 HTML 后约 4,000 token,一段抽取好的分块约 1,000 token,输入价格为每百万 token 3 美元。
纯链接搜索这三次调用的 API 费用约 1.5 美分——然后智能体自己去抓十二个页面,把大约 48,000 个 token 过一遍模型,也就是 14.4 美分。API 只占这个回合的 9%。而每一个把抽取好的正文递回来的端点,都会把这个回合落在 5 到 8.5 美分之间,因为 12,000 token 的分块只要 3.6 美分;面对"喂给模型多少东西"上 10 倍的摆动,API 之间的价差再怎么拉也追不上。
按价目表排序,是 Parallel、Brave、Exa、Tavily。按"跑完一个回合的成本"排序,是 Brave 的 LLM Context 端点、Exa、Parallel、Tavily——而 Brave 的纯链接端点垫底,接近最便宜那个的三倍。第二份榜单上的第一名和最后一名是同一家厂商,价目相同,只差一个端点。这次比较里别的都可以忘,这条请留着:端点的选择比厂商的选择更要紧,而它恰恰是人们随手做掉的那个选择。
那张图刻意略去了三件事,而它们全都往同一个方向推:
- 抓取失败。当抓取由你的智能体来做,总有一部分页面返回的是机器人墙、付费墙、Cookie 弹层或一个只有 JavaScript 外壳的空页。它们要花掉一次请求、一段超时的延迟,往往还要一次重试,而产出为零。由厂商去抓,这个失败率就被它吸收进价格里了。
- 第二遍。原始页面正文通常没法直接进最终答案;智能体还要摘要或重排一遍,那又是一次模型调用,而且落在 token 这条更贵的边上。
- 上下文挤占。四万八千 token 的页面正文不只是一笔费用,更是一份占位——它挤掉了智能体仍然需要的指令与既往步骤,而长上下文远在触到标称上限之前,注意力就开始退化。这正是有效上下文 vs 标称上下文里的论证,它让 token 那一列既是钱的成本,也是质量的成本。
让 API 替你读,你换回来的是什么
分析要是停在这儿,就成了一则抽取端点的广告。不该停,因为把"读"交给厂商,还会连带交出去别的东西。
分块选择是一次你再也看不见的相关性判断
当一个 API 返回"页面里相关的部分"时,是某个东西判定了什么叫相关。你没法检视那个判定,没法拿它和另一种方案做 A/B,也分辨不出"这页里本来就没有答案"和"这页的抽取器把答案所在的那张表丢掉了"。你的智能体最常见的那种失败——凭不完整的证据自信作答——如今有了一个住在别人基础设施上的成因。如果你在认真评估自己的检索质量(而评估 RAG 主张你应该),那你现在评估的是一个你改不了的组件。
它会在你不发版的情况下变
抽取器要么是一个模型,要么是一套启发式,而厂商在持续改进两者。这对你的系统而言是一次无声的输入变更:代码没变、提示词没变,进来的文字变了,出去的答案也变了。你的 CI 什么也抓不到,因为你的 CI 跑的是你的代码。这正是第三方工具漂移里的那个问题,而搜索 API 是它最纯粹的实例——接口稳定,接口背后的内容却在动。
索引覆盖不可互换,而"没有结果"是有歧义的
Brave 用的是自己的抓取;Exa 在关键词匹配之外跑一套神经索引;其余几家混合多个来源。一个神经索引什么也没返回,意思是"没有语义上足够接近的东西",这与关键词索引的"没有文档包含这些词"是两个不同的断言;而一个把其中任何一种当成关于世界的事实的智能体,会自信地告诉用户某样东西不存在。无论你选哪家,那个循环都该能在下任何结论之前,换一种检索方式重新表述并重试一次——见智能体式检索。
延迟会叠加,而且是在循环里叠加
最快与最慢之间 20 倍的差距,听上去像是一项偏好——直到你把它放进一个循环。三次串行搜索、每次 670 毫秒,是两秒钟,用户几乎察觉不到。三次、每次 13.6 秒,就是四十秒里智能体看起来像卡死了;而如果它读完还要再查一轮,那就是一分半。搜索延迟在你的 trace 里不是一个数字,它是一个数字乘以"智能体决定再看一眼"的次数——这正是度量智能体延迟要求量轨迹而不是量调用的全部理由。
什么时候选哪个
| 如果你的智能体…… | 选 | 因为 |
|---|---|---|
| 实时回答用户,每回合查一到两次 | Brave,用 LLM Context 端点 | 实测最快、定价扁平,而且抽取与片段同价 |
| 跑宽口径的研究回合,每次查询要很多条结果 | Exa | 前十条正文已含在价内、之后每千条 1 美元,所以"撒得更宽"恰好是便宜的方向 |
| 需要域名过滤,以及一个按次调用自己拧的深度开关 | Tavily | search_depth 这个参数就是价格杠杆,而它每次查询都由你来设 |
| 想要摘录粒度的控制,外加一个独立的深度研究作业 | Parallel | 快路径按结果与摘录付费;真正的长作业交给 Task API,并按作业去核算 |
| 还没想好 | 挑两个,藏在同一个接口后面 | 切换成本只有一天,而失败模式是按目标站点分布的;除此之外没有别的办法知道哪个索引覆盖了你的领域 |
那条经得起时间的原则:搜索 API 的价格是一个边界标记,不是一笔成本。它告诉你厂商替你执行了检索的哪几段;而你的账单,等于厂商的报价加上这个标记之后所有事情的价钱——后者的计价单位是 token、延迟与失败的抓取,而不是每千次多少美元。在你去比价目表之前,先把一个真实回合端到端地打上探针,把 token 究竟花到哪儿去了写下来。多数团队会发现,搜索那一行还不到他们一直在优化的那个数字的十分之一。
常见问题
最便宜的搜索 API 是不是总是错的选择?
不是——它错在"你的智能体接下来还得自己去抓、去读"的时候,而这是常见情形。如果你本来就跑着一套自己信得过的爬虫与抽取流水线,那只买链接恰恰是对的,一口价的选项也就成了明智之选。真正的错误,是在没有确认自己站在"抓取加抽取"这条边界的哪一侧之前,就去比价目表。
我该用厂商的 answer 或深度研究端点,还是自己那个循环?
对一次性的、没有后续追问的问题,往往该用;它比自己建循环便宜,而厂商也把它调过了。但只要智能体需要根据刚读到的内容去决定下一步找什么,就不该用——那等于你买了一个研究循环,然后还得把它和你自己的推理交错编织,而这两个循环并不复合。注意定价本身也在说这件事:Parallel 的 Task API 大约是它搜索调用的 300 倍,这是一句关于"那些活儿从来就不在搜索里"的陈述。
怎样才算诚实地把它们相互评估一遍?
别用公开基准——用你自己的查询。从你的真实流量里取五十个问题,每个 API 都跑一遍,然后给智能体的最终答案打分,而不是给搜索结果打分,因为结果质量只有透过消费它的那个东西才有意义。接着比较每个完成回合的总成本与 p90 延迟。这是一天的工作量,也是唯一一份能迁移的比较。
搜索 API 能不能挡住它返回的页面里的提示词注入?
不能;而且抽取还可能让情况更糟,因为它会剥掉人类本来会注意到的那些视觉线索。从搜索 API 到来的文字,是你的智能体即将当作指令去读的不可信内容——防御手段在提示词注入与环境权限里,而它们没有一样是厂商能卖给你的。
用 MCP 而不是 HTTP API 去跑搜索呢?
这几家大多都提供 MCP server,而它改变的是集成界面,不是经济性——同样的调用、同样的价钱、同样多的文字落进你的上下文。唯一值得检查的,是这层 MCP 封装的默认参数是否与你本来会选的一致,因为"默认返回十条全文结果"是一个替你做掉的 token 决定。
延伸阅读
本站相关:
- 智能体式检索 —— 决定下一步该搜什么的那个循环。
- 评估 RAG —— 怎么给一层检索打分,包括不属于你的那一层。
- 有效上下文 vs 标称上下文 —— 为什么 token 那一列也是质量成本。
- 成本归因与预算 —— 当花钱多少由智能体决定时,怎么给花费打标签。
- 第三方工具漂移 —— 抽取器变好了会发生什么。