SAG / ARCHITECTURE NOTE
混合搜索:为什么要结合 BM25 与密集检索
本文依据研究和官方文档,介绍混合搜索的定义、必要性与工作原理,并说明其在 SAG 架构中的应用标准及实务检查清单。
一句话定义
混合搜索是结合基于关键词匹配的稀疏检索与基于语义相似度的密集检索的方法。
核心答案:产品名称、代码和法律术语看重精确匹配,而自然语言问题看重语义相似度。只采用一种方式,可能会遗漏另一类相关性。
为什么需要这项技术?
产品名称、代码和法律术语看重精确匹配,而自然语言问题看重语义相似度。只采用一种方式,可能会遗漏另一类相关性。
工作原理
将两个检索器的候选结果和分数归一化,或通过 rank fusion 进行合并,再由 reranker 确定最终顺序。应按数据集评估各自的贡献。
设计时不能只关注准确率。还需要同时定义延迟、成本、数据边界、更新周期以及失败时的行为,才能在实际运行中得到可复现的结果。对于自动化无法确定的值,安全的做法是将其保留为“未测量”或“需要审核”状态,而不是改成 0 或成功。
与 SAG 技术的联系
将搜索层连接到 SAG 的问题与依据结构时,适合采用这样的设计:以稀疏检索补充独特品牌名称的搜索,以密集检索补充上下文型问题。应区分当前 fixture 的结果与未来搜索引擎的结果。
实务检查清单
- 收集精确匹配和语义搜索的失败案例
- 分别评估候选召回率与最终精确率
- 使用验证数据确定组合权重
- 将失败、空结果和权限错误的状态与成功区分开
- 在相同条件下重新验证变更前后的表现
研究与官方文档
参考文档为原理和建议提供依据。它们不保证搜索曝光、AI 提及、排名或销售额;实际应用效果应通过服务数据以及相同条件下的观测来确认。
选择标准与具体应用示例
例如,可以通过精确匹配搜索查找产品代码 AX-210,并通过语义搜索为“适合出差期间长时间使用的产品”查找候选结果。由于两种分数的尺度不同,不应直接相加,而应采用排名合并或经过验证的归一化方法。合并候选结果与重新排序也是两个不同阶段。
SAG 中的适用范围
本文讨论搜索 AI 的研究原理和扩展设计。可以结合 SAG 的页面采集、依据记录和报告验证结构来阅读,但不要将其解读为论文中的搜索算法已全部集成到生产流水线中。具体是否应用,应通过搜索模块、评估数据和执行记录确认。
如何继续了解这项技术
比较 RAG、GraphRAG 和 Self-RAG 论文及其应用条件。
SAG / KNOWLEDGE LINKS
