SAG / ARCHITECTURE NOTE
GraphRAG:将文档片段作为关系与社区来阅读
依据研究和官方文档,介绍 GraphRAG 的定义与必要性、工作原理、在 SAG 架构中的应用标准,以及实践检查清单。
一句话定义
GraphRAG 是一种从文档中提取实体和关系、构建图,并利用社区摘要回答全局问题的方法。
核心回答:向量搜索擅长查找特定句子,但对于询问整个数据集的主要主题或跨多份文档的关系的问题,可能并不够用。
为什么需要这项技术?
向量搜索擅长查找特定句子,但对于询问整个数据集的主要主题或跨多份文档的关系的问题,可能并不够用。
工作原理
构建实体与关系图,并对社区进行层级划分和摘要。全局问题会结合相关社区摘要来回答;局部问题则会检索详细节点和文本依据。
设计时不能只关注准确率。还必须一并明确延迟、成本、数据边界、更新周期以及失败时的行为,才能在实际运营中得到可复现的结果。对于自动化无法确定的值,不要将其改为 0 或标记为成功;将其保留为未测量或需要审核的状态更安全。
与 SAG 技术的关联
SAG 中的问题、页面、来源和竞争对手之间的关系与图模型十分契合,但在验证之前,不应将自动提取的关系确认为事实。需要保留原文出处信息,并由专家审核通过。
实践检查清单
- 为每条图关系关联原文依据
- 区分全局问题与局部问题
- 衡量图构建成本和更新周期
- 将失败、无结果和权限错误的状态与成功区分开
- 在相同条件下重新验证变更前后的结果
研究与官方文档
参考文档为原理和建议提供依据。它们不保证搜索曝光、AI 提及、排名或销售额;实际应用效果必须通过服务数据和相同条件下的观察来验证。
选择标准与具体应用示例
对于“所有客户问题中反复出现的服务缺口是什么?”这类全局问题,跨多份文档的关系和社区摘要可能很有用。对于查找某一项具体规格的问题,简单搜索可能更经济。还应比较关系提取错误和更新摘要所需的成本。
在 SAG 中的适用范围
本文讨论搜索 AI 的研究原理和扩展设计。阅读时可结合 SAG 的页面采集、依据记录和报告验证结构,但不要将其理解为论文中的搜索算法已全部集成到实际运营流水线中。是否应用,应通过搜索模块、评估数据和执行记录来确认。
如何继续了解这项技术
比较 RAG、GraphRAG 和 Self-RAG 论文及其应用条件。
SAG / KNOWLEDGE LINKS
