SAG / ARCHITECTURE NOTE
골든 평가셋: 자동 분석의 개선을 어떻게 회귀 검증하는가?
검토된 질문·근거·기대판정을 고정해 분석 변경의 영향을 비교하는 평가 자료입니다. 모델이나 추출기를 바꿨는데 예쁜 답변만 확인하면 과거 오류가 되살아날 수 있습니다. 검색과 생성·지표의 오류를 따로 측정해야 합니다.
골든 평가셋란 무엇인가?
검토된 질문·근거·기대판정을 고정해 분석 변경의 영향을 비교하는 평가 자료입니다. 이 노트는 골든 평가셋를 기능 이름보다 입력·변환·출력의 책임으로 읽습니다. 분석 결과를 신뢰하려면 어떤 자료가 들어왔고, 무엇을 확인했으며, 어디까지 결론을 낼 수 있는지 이어져야 합니다.
왜 이 기술이 필요한가?
모델이나 추출기를 바꿨는데 예쁜 답변만 확인하면 과거 오류가 되살아날 수 있습니다. 검색과 생성·지표의 오류를 따로 측정해야 합니다.
설계 원리와 데이터 흐름
명확한 정상·결측·반례를 포함하고 근거 일치와 계산·출처 정확도를 별도 평가합니다. 실제 고객 원문 대신 승인된 비식별 자료를 사용할 수 있습니다.
검토된 질문·근거 → 고정 기대 판정 → 회귀·전문가 검토
각 단계는 앞 단계의 성공을 다음 단계의 성과로 바꿔 부르지 않아야 합니다. 자료의 식별자와 기간, 검증 상태를 이어서 기록하면 누락과 오류가 생긴 위치를 찾고 다시 확인할 범위를 정할 수 있습니다.
SAG 아키텍처와의 연결
SAG는 인용 완전성·중복·권한·기간·지표 계산을 회귀 검증합니다. 모델 기반 의미 평가를 확장할 때는 이 기초 검증과 별도 평가셋이 필요합니다.
SAG의 운영 가치는 이 관계를 페이지와 질문, 비교 결과와 개선 작업으로 연결하는 데 있습니다. 고객은 숫자만 읽는 대신 보강할 대상과 판단 근거를 함께 검토할 수 있습니다. 추가 적용이 필요한 패턴은 해당 문단의 범위를 기준으로 읽어야 합니다.
설명용 예제와 판단 기준
설명용 동일URL이 한답변에 두번 인용된 사례는 기대건수1입니다. 목록미확인은0이 아니라 제외입니다. 이런 반례가 있어야 단순한 정상예제로 놓칠 오류를 찾습니다.
위 예제는 구조와 계산을 설명하기 위한 자료이며 특정 고객사의 실측 성과가 아닙니다. 실제 보고서에는 선택한 기간·대상·관측 조건과 원문 기록이 연결돼야 같은 판단을 다시 확인할 수 있습니다.
실무 검증 체크리스트
| 흐름 단계 | 확인할 항목 |
|---|---|
| 검토된 질문·근거 | 정상·결측·반례 구성 |
| 고정 기대 판정 | 검색·생성·계산 분리 |
| 회귀·전문가 검토 | 평가 버전과 오류 보존 |
정상 입력뿐 아니라 비어 있는 자료, 중복 자료와 조건이 다른 자료에서도 같은 의미를 유지하는지 확인하세요. 검증 항목을 작업 완료 기준에 연결하면 기능 설명과 실제 운영의 차이를 줄일 수 있습니다.
한계와 적용 시 주의점
자동평가자의 점수도 정답 보증은 아닙니다. 전문가 검토와 오판사례·평가버전·표본범위를 함께 보존해야 합니다.
연구와 공식 문서
- RAGAs 평가 연구 — 검색과 생성 결과를 평가하는 연구이며 점수의 목적과 한계를 확인합니다.
외부 자료는 위 설계 주제의 배경이며 SAG의 모든 구현이나 고객 성과를 인증하는 자료가 아닙니다. 이 노트의 적용 해석과 설명용 예제는 SAG 운영 구조를 기준으로 정리했습니다. 자료 확인: 2026-10-06.
이어 읽기와 기능 확인
이 기술을 이어서 읽는 방법
SEO·AEO·GEO, 엔티티와 JSON-LD가 각각 해결하는 문제를 읽습니다.
SAG / KNOWLEDGE LINKS
