AI 博客

Brave vs Exa vs Tavily vs Parallel:计价单位说明了谁去读那个页面

这四家把一次搜索定在每千次 1 到 16 美元之间,而这道价差不是毛利——它是各自在检索流水线上读到多深。改用"一整个研究回合"而不是"一次调用"来计价,排序就会翻转:价目表最便宜的那个,跑出来的回合成本是最贵那个的三倍。

作者 智能体 AI 维基 27 分钟读完

这几家里,有一家一千次搜索卖你一美元,另一家要收十六美元,而两个价格都很诚实——它们卖的本来就是不同分量的活儿。一个搜索 API 用什么单位计价,恰好说明了它在检索流水线上读到哪一步为止;而它没做完的每一段,你的智能体照样要付账,只是付在抓取失败、延迟和 token 上。请给整个回合计价,而不是给一次调用计价——这么一算,价目表上最便宜的那个 API,反而成了你能挑到的最贵的一个。

一览

四个智能体开发者真正会去用的 API,价格取自 2026 年 8 月公布的价目表。先读第三列——决定你账单的是它。

API基础价目一个计价单位包含什么它读到哪儿为止
Brave Search API 每 1,000 次调用 5 美元,各网页搜索端点统一价 来自 Brave 自有索引的排序结果;另有一个 LLM Context 端点,以同样的价目返回抽取好的"smart chunks" 片段——若改调另一个端点,则读到完整抽取
Exa 每 1,000 次搜索 7 美元(≤10 条结果) 神经检索与关键词检索,自 2026 年 3 月的定价调整起,前十条结果的页面正文已含在价内;第十条之后每 1,000 条加收 1 美元 抽取好的正文,就在基础调用里
Tavily 按积分计——即用即付每分 0.008 美元,走量可降到 0.005 一次 basic 搜索花 1 分、返回片段;一次 advanced 搜索花 2 分,会去抓取页面并抽出干净正文 取决于你把 search_depth 设在哪儿
Parallel 基础请求 0.001 美元返回十条结果,每多一条结果与摘录再加 0.001 带摘录的结果;另有一个 Task API,把一整份研究作业跑完,每 1,000 次起价 300 美元 摘录——研究循环是另一个产品
Where each search API stops along the retrieval pipeline A five-stage pipeline runs across the top: rank the index, return snippets, fetch the live pages, extract clean text, and compress into an answer. Below it, four rows show how far each vendor's base endpoint covers that pipeline as a solid bar, and how far a higher-priced endpoint from the same vendor extends as a lighter bar. Brave and Tavily's base endpoints stop after snippets; Exa's base covers extraction; Parallel's base returns excerpts; every vendor sells a longer endpoint at a higher price. One retrieval pipeline, five stages STAGE 1 Rank index query → URLs STAGE 2 Snippets title + excerpt STAGE 3 Fetch pages live HTTP, bot walls STAGE 4 Extract clean text, chunks STAGE 5 Compress answer / research Brave $5 / 1k, flat /web/search LLM Context — same $5 / 1k Exa $7 / 1k base /search — contents for the first 10 bundled Answer $5 Tavily 1 credit basic basic — 1 credit advanced — 2 credits Parallel $0.001 + per result search — results with excerpts Task API — from $300 / 1k base endpoint longer endpoint from the same vendor
所有人卖的都是同一条流水线,只是切在不同的位置。没被覆盖的那几段不会凭空消失;它们挪进了你的智能体里。

还有两个数字框定了这个市场。2026 年 8 月一份针对八个智能体搜索 API 的独立评测里,Brave 在答案质量上以微弱优势居首,Exa、Firecrawl 与 Parallel 的 Pro 档紧随其后、差距近到可能只是噪声,而 Brave 领先 Tavily 约一分。同一份评测测到延迟有 20 倍的跨度:快的一端约 670 毫秒,慢的一端 13.6 秒。请记住第二个数字;它造成的伤害,大于第一个数字带来的好处。

四种计价单位,四个不同的产品

计价单位就是一份设计文档。它告诉你厂商认为自己在卖什么;而通过它没说的部分,也告诉你厂商指望你自己去建什么。

Brave:一次调用一口价,外加一个把整笔账重算的第二端点

Brave 按搜索引擎的方式定价,因为它本来就是一个——自有抓取与索引、每千次调用 5 美元一口价、没有按结果数算的算术。这份"平"比看上去值钱:四家里只有它能让你不用打开表格,就从这个月的请求数推出下个月的账单。2026 年 2 月免费额度被取消、改为每月 5 美元赠金,惹恼了不少业余项目,但没有改变任何结构性的东西。

有意思的是那个 LLM Context 端点:它跑一次查询、打开排名靠前的页面,把清洗过的分块返回给你——正文、JSON-LD 结构化数据、代码块、论坛帖、视频字幕——价格同样是每千次 5 美元。同一个价钱,两个产品,分踞那条要紧的线的两侧。多数评测把 Brave 归为"便宜的片段选项";而这只对人们碰巧先接上的那个端点成立。

Exa:正文本身就是产品,而且基础调用里已经带上了

Exa 按搜索次数计价,并把前十条结果的页面正文折进那 7 美元里。2026 年 3 月之前正文是单独计费的,而这次改动不只是一次打折——它把 Exa 的默认形态从"一个你之后还要去读的搜索 API"挪成了"一个直接把正文递给你的检索 API"。超过十条之后,每多一条按每千条 1 美元计,于是成本跟着"你撒网有多宽"走,而不是跟着"你发了多少次查询"走;对一个宁可跑一次宽搜索、也不跑五次窄搜索的智能体来说,这正是对的形状。

再往上是每千次 12 美元的 Deep Search 与 15 美元的深度推理搜索、5 美元的 Answer 端点,以及给常驻查询用的、每千次 15 美元的 Monitors。这套分档对"多读一些要花多少钱"是诚实的;而它也正是为什么,一个建立在"搜索端点是 7 美元"之上的天真成本模型,会低估一个在循环里悄悄调用 Answer 的系统。

Tavily:按积分,因为工作量本来就确实在变

Tavily 是唯一把"深度开关"显式定价的那一家。一次 basic 搜索 1 分;一次 advanced 搜索 2 分,而多出的那一分买的是"抓取加抽取"这一遍——API 会打开页面、返回干净正文而不是片段。按即用即付每分 0.008 美元算,分别是每千次 8 美元与 16 美元,走量套餐可降到 0.005;免费额度是每月 1,000 分,付费套餐从 30 美元 4,000 分起。

积分模型很诚实,同时也是四家里最不可预测的一个,因为单次 Research 调用可能消耗 4 到 250 分不等,取决于它走多深。由人来触发时,这没问题。放进一个自主循环里就是另一回事了——因为决定钻多深的那个东西,和花钱的那个东西是同一个。这类隐患的一般形态在成本归因与预算里。

Parallel:按结果与摘录计,研究循环单独卖

Parallel 的搜索定价是一条公式而不是一个数字:基础请求 0.001 美元返回十条结果,每多一条结果与摘录加 0.001,advanced 模式起步 0.005。在最小配置下,这就是每千次请求 1 美元——本次比较里最便宜的标价,比第二名还便宜五倍。

这条公式本身就是线索。Parallel 收的是"它递给你多少文字"的钱,说明它想过本文通篇在讲的这件事——而它也把贵的那一半拆出去做成了 Task API:一次深度研究运行每千次起价 300 美元,最重的档位涨到 2,400 美元。这两个产品分踞同一条线的两侧,价格相差 300 倍;关于"搜索调用里到底装了多少活儿",这是一句相当精确的陈述。

给回合计价,而不是给调用计价

下面这笔账会把排名重新洗一遍。取一个普通的研究回合:智能体发出三次搜索,最后读了十二个页面。假定一个页面剥掉 HTML 后约 4,000 token,一段抽取好的分块约 1,000 token,输入价格为每百万 token 3 美元。

Cost of one research turn by endpoint, split into API charge and token charge Stacked horizontal bars for a turn of three searches over twelve pages. Brave's links-only web search endpoint costs 1.5 cents in API charges but 14.4 cents in tokens once the agent fetches and reads the pages itself, for 15.9 cents total. Brave's LLM Context endpoint at the same list price totals 5.1 cents, Exa's search endpoint 5.7 cents, Parallel's search with excerpts 6.6 cents, and Tavily advanced 8.4 cents. The endpoint with the lowest API charge has the highest total. Cost of one research turn — 3 searches, 12 pages read (US cents) Brave /web/search links only — agent reads 15.9 Brave LLM Context same list price, chunks 5.1 Exa /search contents for first 10 bundled 5.7 Parallel search 10 results with excerpts 6.6 Tavily advanced 2 credits, pages extracted 8.4 0 4 8 12 16 API charge tokens the agent pays to read what came back
API 费用是短的那一段。价目表上最低的那个端点,产出的总额最高——高出约三倍。

纯链接搜索这三次调用的 API 费用约 1.5 美分——然后智能体自己去抓十二个页面,把大约 48,000 个 token 过一遍模型,也就是 14.4 美分。API 只占这个回合的 9%。而每一个把抽取好的正文递回来的端点,都会把这个回合落在 5 到 8.5 美分之间,因为 12,000 token 的分块只要 3.6 美分;面对"喂给模型多少东西"上 10 倍的摆动,API 之间的价差再怎么拉也追不上。

按价目表排序,是 Parallel、Brave、Exa、Tavily。按"跑完一个回合的成本"排序,是 Brave 的 LLM Context 端点、Exa、Parallel、Tavily——而 Brave 的纯链接端点垫底,接近最便宜那个的三倍。第二份榜单上的第一名和最后一名是同一家厂商,价目相同,只差一个端点。这次比较里别的都可以忘,这条请留着:端点的选择比厂商的选择更要紧,而它恰恰是人们随手做掉的那个选择。

那张图刻意略去了三件事,而它们全都往同一个方向推:

  • 抓取失败。当抓取由你的智能体来做,总有一部分页面返回的是机器人墙、付费墙、Cookie 弹层或一个只有 JavaScript 外壳的空页。它们要花掉一次请求、一段超时的延迟,往往还要一次重试,而产出为零。由厂商去抓,这个失败率就被它吸收进价格里了。
  • 第二遍。原始页面正文通常没法直接进最终答案;智能体还要摘要或重排一遍,那又是一次模型调用,而且落在 token 这条更贵的边上。
  • 上下文挤占。四万八千 token 的页面正文不只是一笔费用,更是一份占位——它挤掉了智能体仍然需要的指令与既往步骤,而长上下文远在触到标称上限之前,注意力就开始退化。这正是有效上下文 vs 标称上下文里的论证,它让 token 那一列既是钱的成本,也是质量的成本。

让 API 替你读,你换回来的是什么

分析要是停在这儿,就成了一则抽取端点的广告。不该停,因为把"读"交给厂商,还会连带交出去别的东西。

分块选择是一次你再也看不见的相关性判断

当一个 API 返回"页面里相关的部分"时,是某个东西判定了什么叫相关。你没法检视那个判定,没法拿它和另一种方案做 A/B,也分辨不出"这页里本来就没有答案"和"这页的抽取器把答案所在的那张表丢掉了"。你的智能体最常见的那种失败——凭不完整的证据自信作答——如今有了一个住在别人基础设施上的成因。如果你在认真评估自己的检索质量(而评估 RAG 主张你应该),那你现在评估的是一个你改不了的组件。

它会在你不发版的情况下变

抽取器要么是一个模型,要么是一套启发式,而厂商在持续改进两者。这对你的系统而言是一次无声的输入变更:代码没变、提示词没变,进来的文字变了,出去的答案也变了。你的 CI 什么也抓不到,因为你的 CI 跑的是你的代码。这正是第三方工具漂移里的那个问题,而搜索 API 是它最纯粹的实例——接口稳定,接口背后的内容却在动。

索引覆盖不可互换,而"没有结果"是有歧义的

Brave 用的是自己的抓取;Exa 在关键词匹配之外跑一套神经索引;其余几家混合多个来源。一个神经索引什么也没返回,意思是"没有语义上足够接近的东西",这与关键词索引的"没有文档包含这些词"是两个不同的断言;而一个把其中任何一种当成关于世界的事实的智能体,会自信地告诉用户某样东西不存在。无论你选哪家,那个循环都该能在下任何结论之前,换一种检索方式重新表述并重试一次——见智能体式检索

延迟会叠加,而且是在循环里叠加

最快与最慢之间 20 倍的差距,听上去像是一项偏好——直到你把它放进一个循环。三次串行搜索、每次 670 毫秒,是两秒钟,用户几乎察觉不到。三次、每次 13.6 秒,就是四十秒里智能体看起来像卡死了;而如果它读完还要再查一轮,那就是一分半。搜索延迟在你的 trace 里不是一个数字,它是一个数字乘以"智能体决定再看一眼"的次数——这正是度量智能体延迟要求量轨迹而不是量调用的全部理由。

什么时候选哪个

如果你的智能体……因为
实时回答用户,每回合查一到两次Brave,用 LLM Context 端点实测最快、定价扁平,而且抽取与片段同价
跑宽口径的研究回合,每次查询要很多条结果Exa前十条正文已含在价内、之后每千条 1 美元,所以"撒得更宽"恰好是便宜的方向
需要域名过滤,以及一个按次调用自己拧的深度开关Tavilysearch_depth 这个参数就是价格杠杆,而它每次查询都由你来设
想要摘录粒度的控制,外加一个独立的深度研究作业Parallel快路径按结果与摘录付费;真正的长作业交给 Task API,并按作业去核算
还没想好挑两个,藏在同一个接口后面切换成本只有一天,而失败模式是按目标站点分布的;除此之外没有别的办法知道哪个索引覆盖了你的领域
Feature matrix of four agent search APIs across five axes Rows are Brave, Exa, Tavily and Parallel. Columns are contents included at the base price, control over what comes back, latency, price predictability, and whether a dedicated deep-research product exists. Cells are shaded on three levels. Brave is strongest on latency and price predictability and weakest on control and deep research; Exa is strongest on bundled contents and deep research; Tavily includes extraction at advanced depth but has the least predictable pricing; Parallel is strongest on deep research and weakest on latency. Where each API leans hardest CONTENTS AT BASE CONTROL LATENCY PRICE PREDICT. DEEP RESEARCH Brave Medium same-price endpoint Weak take the chunks given Strong fastest measured Strong flat $5 / 1k Weak no such product Exa Strong first 10 bundled Medium content type, highlights Medium mid-pack Medium tier per endpoint Strong Deep Search $12–15 Tavily Strong advanced fetches pages Medium depth, domain filters Medium mid-pack Weak 4–250 credits a call Medium Research, variable Parallel Medium excerpts, not pages Medium results × excerpts Weak Pro slowest measured Medium formula per result Strong Task API, priced apart Strong Medium Weak List prices and public figures as of August 2026.
没有哪一列被同一家厂商连赢两次。在一个所有人都在切同一条流水线的市场里,这就是它该有的样子。

那条经得起时间的原则:搜索 API 的价格是一个边界标记,不是一笔成本。它告诉你厂商替你执行了检索的哪几段;而你的账单,等于厂商的报价加上这个标记之后所有事情的价钱——后者的计价单位是 token、延迟与失败的抓取,而不是每千次多少美元。在你去比价目表之前,先把一个真实回合端到端地打上探针,把 token 究竟花到哪儿去了写下来。多数团队会发现,搜索那一行还不到他们一直在优化的那个数字的十分之一。

常见问题

最便宜的搜索 API 是不是总是错的选择?

不是——它错在"你的智能体接下来还得自己去抓、去读"的时候,而这是常见情形。如果你本来就跑着一套自己信得过的爬虫与抽取流水线,那只买链接恰恰是对的,一口价的选项也就成了明智之选。真正的错误,是在没有确认自己站在"抓取加抽取"这条边界的哪一侧之前,就去比价目表。

我该用厂商的 answer 或深度研究端点,还是自己那个循环?

对一次性的、没有后续追问的问题,往往该用;它比自己建循环便宜,而厂商也把它调过了。但只要智能体需要根据刚读到的内容去决定下一步找什么,就不该用——那等于你买了一个研究循环,然后还得把它和你自己的推理交错编织,而这两个循环并不复合。注意定价本身也在说这件事:Parallel 的 Task API 大约是它搜索调用的 300 倍,这是一句关于"那些活儿从来就不在搜索里"的陈述。

怎样才算诚实地把它们相互评估一遍?

别用公开基准——用你自己的查询。从你的真实流量里取五十个问题,每个 API 都跑一遍,然后给智能体的最终答案打分,而不是给搜索结果打分,因为结果质量只有透过消费它的那个东西才有意义。接着比较每个完成回合的总成本与 p90 延迟。这是一天的工作量,也是唯一一份能迁移的比较。

搜索 API 能不能挡住它返回的页面里的提示词注入?

不能;而且抽取还可能让情况更糟,因为它会剥掉人类本来会注意到的那些视觉线索。从搜索 API 到来的文字,是你的智能体即将当作指令去读的不可信内容——防御手段在提示词注入环境权限里,而它们没有一样是厂商能卖给你的。

用 MCP 而不是 HTTP API 去跑搜索呢?

这几家大多都提供 MCP server,而它改变的是集成界面,不是经济性——同样的调用、同样的价钱、同样多的文字落进你的上下文。唯一值得检查的,是这层 MCP 封装的默认参数是否与你本来会选的一致,因为"默认返回十条全文结果"是一个替你做掉的 token 决定。

延伸阅读

本站相关:

资料来源: