SAG / ARCHITECTURE NOTE
RAG 溯源与引用追踪:从回答回溯到原文
结合研究与官方文档,说明 RAG 溯源的定义、必要性和工作原理,以及其在 SAG 架构中的应用标准与实务检查清单。
一句话定义
RAG 溯源是一种将回答中的句子、检索到的文档、原文位置和运行版本关联起来,以追踪结果来源的结构。
核心答案:仅附上 URL 列表,很难判断哪些依据支撑了哪些句子。文档发生变化后,即使 URL 相同,内容也可能不同。
为什么需要这项技术?
仅附上 URL 列表,很难判断哪些依据支撑了哪些句子。文档发生变化后,即使 URL 相同,内容也可能不同。
工作原理
保存文档 ID 和版本、chunk 位置、检索分数及是否采用等信息,并将回答中的主张与引用关联起来。通过原文 hash 验证是否发生变更。
设计时不能只关注准确度。还必须一并定义延迟、成本、数据边界、更新周期和故障时的行为,才能在实际运行中获得可复现的结果。对于自动化无法确信的值,安全的做法是将其保留为“未测量”或“需要审核”状态,而不是改成 0 或成功。
与 SAG 技术的关联
SAG 的结构会在 report provenance 中记录输入、采集和规范化 hash,以及规则、模型、prompt 和 schema 版本。这些记录有助于提高基于证据的回答的可审计性。
实务检查清单
- 确认引用确实支持对应的句子
- 保存文档版本和采集时间
- 制定已删除或已更改来源的处理政策
- 将失败、空结果和权限错误的状态与成功区分开
- 在相同条件下重新验证变更前后的结果
研究与官方文档
参考文档为原理和建议提供依据,但不保证搜索曝光、AI 提及、排名或收入。实际应用效果应通过服务数据和相同条件下的观测进行验证。
如何继续了解这项技术
区分月度样本、引用率分母、竞争基准和 Goal 达成率。
SAG / KNOWLEDGE LINKS
