OpenAI、Cohere、Voyage 与 Qwen3:那个换不起的模型
换掉 LLM,改的是一段提示词。换掉嵌入模型,要重嵌整个语料、重建索引,并让你手上所有检索数字全部作废——两个模型产出的向量彼此不可比,因此不存在渐进迁移。这让它成为 RAG 栈里唯一一个在锁定状态下做出的选择,而真正定案的数字是每条向量占多少字节、以及模型的生命周期由谁掌控,不是排行榜名次。
换掉 LLM,改的是一段提示词。换掉嵌入模型,要重嵌整个语料、重建索引,并让你手上所有检索数字全部作废——两个模型产出的向量彼此不可比,因此不存在渐进迁移。这让它成为 RAG 栈里唯一一个在锁定状态下做出的选择,而真正定案的数字是每条向量占多少字节、以及模型的生命周期由谁掌控,不是排行榜名次。
在挑本地向量存储之前,先注意一件事:Claude Code、Cursor 与 Codex 都把自己的删掉了——领先的编程智能体用 grep 检索,而不是嵌入。如果你的语料仍然需要索引,那么这四者并非互相竞争的产品,而是四种不同的架构:一个不带存储的搜索库、一个 SQLite 扩展、一个带预写日志的嵌入式引擎,以及一种落在磁盘上的列式格式。
四款向量库,四份几乎一致的功能清单——ANN、过滤、混合检索,一个不落。真正决定谁能在生产环境的智能体 RAG 栈中扛下去的那一点,在功能清单上根本看不见:索引相对于你主数据所在的位置。