深度剖析 / 检索与 RAG
检索与 RAG
检索增强生成的进阶——高级架构、图 RAG、把检索作为智能体工具、RAG 安全。
- 进阶 RAG 架构朴素→模块化→智能体式 RAG 谱系与关键杠杆——CRAG、Self-RAG、查询变换、融合、重排序——全都在攻击同一个“垃圾进、自信错出”的失败。
- GraphRAG 与多跳检索为什么扁平 top-k RAG 回答不了主题型或关系型多跳查询,微软 GraphRAG 与迭代检索-推理循环如何解决,以及何时不该用的成本/陈旧化启发式。
- 混合检索与重排序为什么单一检索器在结构上不够、跨 BM25 + 稠密的倒数排名融合、"检索-再交叉编码器"两阶段模式,以及交叉编码器太慢时 ColBERT 式晚交互的位置。
- 文档解析与摄取质量摄取是不被仪表盘照亮、却决定答案是否曾可被索引的那半 RAG——布局感知解析、表格、OCR、结构化分块,以及作为解析逃生阀的视觉 RAG。
- 查询理解与变换在搜索之前先修好问题——改写、分解、多查询、HyDE 告诫、退一步提示、以及路由——给 RAG 流水线加智能最便宜的地方。
- 智能体式检索:把搜索做成工具把检索做成模型在 ReAct 式循环中迭代调用的工具,带预算、停止判据,以及把方向盘交给模型后随之而来的新失败模式(原地循环、漂移、过早停止)。
- 评估 RAG把检索、接地与答案质量当作三件独立的事来打分——recall@k、忠实性、答案相关性——加上如何构建一个持续生长的小评测集,以及在不自欺欺人前提下使用 LLM 裁判。
- 选向量数据库一份约束优先的选型指南——向量库到底是什么、产品之间真正不同的那些轴(ANN 算法、过滤质量、新鲜度、混合检索、多租户、运维、成本)、读懂厂商话术所需的最少 HNSW/IVF/DiskANN 内部知识,以及为何多数团队最终落在 pgvector。
- 本地优先检索在自己的硬件上搭知识库——先问你到底需不需要索引,因为领先的编程智能体已经把索引拿掉换成了 grep。摄取质量、嵌入模型规格、四种存储架构、混合检索、通过 MCP 交给智能体,以及什么时候干脆跑一个成品平台。
- 索引新鲜度与失效陈旧的索引会给出一个带引用的自信答案,而语料变陈旧的三种方式爆炸半径各不相同——一段过时的文字是尴尬,一份已删除却仍在作答的文档是事故。为什么每夜全量重爬是一张账单而不是一份保证、如何让失效由一条在删除上可靠地不可靠的变更流驱动、压实之前先立墓碑、那些一点都不继承删除的派生物,以及把「变更到可检索」做成按来源的 p99 并且有人署名。
- 上下文化检索一套称职的 RAG 栈里召回失败最大的来源,是你把文档切开的那一刻:那个写着「营收增长 3%」的分块,既没点公司、也没点季度和年份。在嵌入前前置一段生成的引子,能把 top-20 检索失败率降低 35%,让同一段引子也进 BM25 则降低 49%,再叠上重排降低 67%(5.7% 降到 1.9%),在提示词缓存下成本约为每百万文档令牌 1.02 美元——但你的索引从此成了第二个模型与一段你迟早想改的提示词的函数,所以按三次重建做预算,并先试标题路径前缀、重排器与混合检索。
- 晚交互检索那条标准反对意见——「每个 token 一个向量,存储是一百倍」——已过时四年,却仍在决定架构:ColBERTv2 的残差压缩把 MS MARCO 在每维两比特下从 154 GiB 压到 25 GiB,与同样 884 万条段落上一个普通 float32 单向量索引同一数量级,而 token 池化还能再去掉一半向量、实测几乎无代价。所以真正的决定是诊断性的——更好的第一阶段只修召回失败;而 2026 年一项分离结果指出,单向量在结构上失手的那些查询,正是智能体实际发出的多约束合取查询。对页面图像来说,要比的根本不是你的检索器,而是被 ColPali 式检索删掉的那条解析流水线。