SAG / ARCHITECTURE NOTE
黄金评测集:如何对自动分析的改进进行回归验证?
这是一套固定经过审核的问题、依据和预期判定结果的评测资料,用于比较分析变更的影响。更换模型或提取器后,如果只检查答案是否漂亮,过去的错误可能会再次出现。应分别衡量检索、生成和指标方面的错误。
什么是黄金评测集?
这是一套固定经过审核的问题、依据和预期判定结果的评测资料,用于比较分析变更的影响。 本说明将黄金评测集视为输入、转换和输出各环节的职责,而不是某个功能的名称。要信任分析结果,就必须清楚地衔接输入了哪些资料、检查了什么,以及结论能够得出到什么程度。
为什么需要这项技术?
更换模型或提取器后,如果只检查答案是否漂亮,过去的错误可能会再次出现。应分别衡量检索、生成和指标方面的错误。
设计原则与数据流
应包含明确的正常情况、缺失情况和反例,并分别评估依据的一致性以及计算与来源的准确性。可以使用经批准的去标识化资料,而非客户原始文本。
经过审核的问题与依据 → 固定的预期判定 → 回归与专家审核
每个阶段都不应将前一阶段的成功称作后一阶段的成果。连续记录资料的标识符、时间段和验证状态,有助于定位遗漏和错误出现的位置,并确定需要重新检查的范围。
与 SAG 架构的关联
SAG 对引用完整性、重复项、权限、时间段和指标计算进行回归验证。扩展基于模型的语义评估时,需要将其与这些基础验证分开,并使用单独的评测集。
SAG 的运营价值在于将这些关系与页面、问题、比较结果和改进工作关联起来。客户不必只看数字,也可以一并审核需要补充的对象和判断依据。对于需要进一步应用的模式,应以相应段落的范围为准进行解读。
说明性示例与判断标准
说明性示例中,同一 URL 在一个答案里被引用两次,预期数量为 1。未确认列表不应视为 0,而应排除。只有包含这类反例,才能发现简单的正常示例会遗漏的错误。
上述示例用于说明结构和计算,并非特定客户的实际测量成果。实际报告应关联所选时间段、对象、观测条件和原始记录,以便重新核实同一判断。
实务验证清单
| 流程阶段 | 确认事项 |
|---|---|
| 经过审核的问题与依据 | 正常情况、缺失情况和反例的构成 |
| 固定的预期判定 | 区分检索、生成和计算 |
| 回归与专家审核 | 保留评测版本和错误 |
请确认在正常输入、资料为空、资料重复以及条件不同的情况下,含义是否仍然一致。将验证项目纳入工作完成标准,有助于缩小功能说明与实际运营之间的差距。
局限与应用注意事项
自动评估器的分数也不保证正确。必须同时保留专家审核记录、误判案例、评测版本和样本范围。
研究与官方文档
- RAGAs 评估研究 — 这项研究评估检索和生成结果;请确认分数的用途与局限。
外部资料为上述设计主题提供背景,并不认证 SAG 的所有实现或客户成果。本说明中的应用解读和说明性示例依据 SAG 的运营结构整理。资料核查日期:2026-10-06。
延伸阅读与功能体验
如何继续了解这项技术
了解 SEO、AEO、GEO、实体和 JSON-LD 分别解决的问题。
SAG / KNOWLEDGE LINKS
