---
title: "RAGAS 与 RAG 评估：为什么必须分别衡量检索与回答"
slug: "ragas-rag-evaluation"
language: "zh-cn"
tags: ["rag 평가","sag 기술","아키텍처","검색 ai 연구"]
created: "2026-09-04T00:00:00.000Z"
published: "2026-10-08T10:00:02.840Z"
updated: "2026-10-08T10:00:02.840Z"
sample: false
---

# RAGAS 与 RAG 评估：为什么必须分别衡量检索与回答

## 一句话定义

**RAG 评估**是在缺少标准答案标签的环境中，通过 faithfulness、answer relevance、context relevance 等维度诊断 RAG 流水线的方法。

> 核心回答：只看最终回答的单一分数，无法判断是检索失败，还是生成过程忽略了依据。要找到需要改进的环节，就必须拆分评估维度。

## 为什么需要这项技术？

只看最终回答的单一分数，无法判断是检索失败，还是生成过程忽略了依据。要找到需要改进的环节，就必须拆分评估维度。

## 工作原理

根据问题、检索到的上下文和回答，评估依据忠实度与相关性；在可行的情况下，将结果与人工构建的基准数据集进行对照。还要抽样检查自动评估模型的偏差。

设计时不能只关注准确率。还必须一并定义延迟、成本、数据边界、更新周期和失败时的行为，才能在实际运行中得到可复现的结果。对于自动化系统无法确定的值，安全的做法是将其保留为“未测量”或“需要审核”状态，而不是将其改为 0 或成功。

## 与 SAG 技术的关联

SAG 不会将规则结果与实际 AI 观测结果合并，而是保留未测量状态。连接 RAG 评估时，也应在 provenance 中记录评估模型、prompt 和数据集的版本。

## 实践检查清单

- 分开统计 retrieval 和 generation 指标
- 由人工重新检查自动评估样本
- 固定评估模型和 prompt 版本
- 将失败、空结果和权限错误状态与成功区分开
- 在相同条件下重新验证变更前后的结果

## 研究与官方文档

- [RAGAS 原论文](https://aclanthology.org/2024.eacl-demo.16/)

参考文档为原理和建议提供依据，但不保证搜索曝光、AI 提及、排名或营收。实际应用效果应通过服务数据和相同条件下的观测来验证。

## 选择标准与具体应用示例

如果找到了相关文档，但回答却添加了文档中没有的规格，那么检索相关性和依据忠实度会得出不同结果。自动评估器的判断不等同于人工的标准答案判定。应使用固定的问题集和经人工确认的错误案例来校准指标。

## 在 SAG 中的适用范围

本文讨论搜索 AI 的研究原理和扩展设计。阅读时可结合 SAG 的页面采集、依据记录和报告验证结构，但不要将其理解为论文中的搜索算法已全部部署到生产流水线中。是否应用，应通过搜索模块、评估数据和运行记录来确认。


## 如何继续了解这项技术

比较 RAG、GraphRAG 和 Self-RAG 论文及其应用条件。

- [搜索 AI 的扩展原理](/ko/blog?tag=%EA%B2%80%EC%83%89%20AI%20%EC%97%B0%EA%B5%AC)
- [功能说明 FAQ](/zh-cn/faq)
