SAG / ARCHITECTURE NOTE

黄金评测集:如何对自动分析的改进进行回归验证?

这是一套固定经过审核的问题、依据和预期判定结果的评测资料,用于比较分析变更的影响。更换模型或提取器后,如果只检查答案是否漂亮,过去的错误可能会再次出现。应分别衡量检索、生成和指标方面的错误。

下载Markdown

什么是黄金评测集?

这是一套固定经过审核的问题、依据和预期判定结果的评测资料,用于比较分析变更的影响。 本说明将黄金评测集视为输入、转换和输出各环节的职责,而不是某个功能的名称。要信任分析结果,就必须清楚地衔接输入了哪些资料、检查了什么,以及结论能够得出到什么程度。

为什么需要这项技术?

更换模型或提取器后,如果只检查答案是否漂亮,过去的错误可能会再次出现。应分别衡量检索、生成和指标方面的错误。

设计原则与数据流

应包含明确的正常情况、缺失情况和反例,并分别评估依据的一致性以及计算与来源的准确性。可以使用经批准的去标识化资料,而非客户原始文本。

经过审核的问题与依据 → 固定的预期判定 → 回归与专家审核

每个阶段都不应将前一阶段的成功称作后一阶段的成果。连续记录资料的标识符、时间段和验证状态,有助于定位遗漏和错误出现的位置,并确定需要重新检查的范围。

与 SAG 架构的关联

SAG 对引用完整性、重复项、权限、时间段和指标计算进行回归验证。扩展基于模型的语义评估时,需要将其与这些基础验证分开,并使用单独的评测集。

SAG 的运营价值在于将这些关系与页面、问题、比较结果和改进工作关联起来。客户不必只看数字,也可以一并审核需要补充的对象和判断依据。对于需要进一步应用的模式,应以相应段落的范围为准进行解读。

说明性示例与判断标准

说明性示例中,同一 URL 在一个答案里被引用两次,预期数量为 1。未确认列表不应视为 0,而应排除。只有包含这类反例,才能发现简单的正常示例会遗漏的错误。

上述示例用于说明结构和计算,并非特定客户的实际测量成果。实际报告应关联所选时间段、对象、观测条件和原始记录,以便重新核实同一判断。

实务验证清单

流程阶段确认事项
经过审核的问题与依据正常情况、缺失情况和反例的构成
固定的预期判定区分检索、生成和计算
回归与专家审核保留评测版本和错误

请确认在正常输入、资料为空、资料重复以及条件不同的情况下,含义是否仍然一致。将验证项目纳入工作完成标准,有助于缩小功能说明与实际运营之间的差距。

局限与应用注意事项

自动评估器的分数也不保证正确。必须同时保留专家审核记录、误判案例、评测版本和样本范围。

研究与官方文档

  • RAGAs 评估研究 — 这项研究评估检索和生成结果;请确认分数的用途与局限。

外部资料为上述设计主题提供背景,并不认证 SAG 的所有实现或客户成果。本说明中的应用解读和说明性示例依据 SAG 的运营结构整理。资料核查日期:2026-10-06。

延伸阅读与功能体验

如何继续了解这项技术

了解 SEO、AEO、GEO、实体和 JSON-LD 分别解决的问题。

文章列表