SAG / ARCHITECTURE NOTE

RAGプロベナンスと引用の追跡:回答から原文に戻る

RAGプロベナンスの定義と必要性、仕組み、SAGアーキテクチャへの適用基準と実務チェックリストを、研究および公式文書を根拠に解説します。

Markdownをダウンロード

一文で定義

RAGプロベナンスとは、回答の文、検索された文書、原文の位置、実行バージョンを結び付け、結果の出所を追跡するための構造です。

要点:URLの一覧を付けるだけでは、どの文がどの根拠によって裏付けられているのか分かりにくくなります。文書が変更されると、同じURLでも内容が異なる場合があります。

なぜこの技術が必要なのか?

URLの一覧を付けるだけでは、どの文がどの根拠によって裏付けられているのか分かりにくくなります。文書が変更されると、同じURLでも内容が異なる場合があります。

仕組み

文書IDとバージョン、chunkの位置、検索スコア、使用の有無を保存し、回答内のclaimと引用を結び付けます。原文のhashによって変更の有無を検証します。

設計時に見るべきなのは精度だけではありません。遅延時間、コスト、データ境界、更新頻度、障害時の動作も併せて定義することで、運用時に結果を再現できるようになります。自動化が確信を持てない値を0や成功に置き換えず、未測定・要確認の状態として残すのが安全です。

SAGの技術との関連

SAGは、入力・収集・正規化のhashと、ルール・モデル・prompt・schemaのバージョンをreport provenanceに記録する構造を備えています。この記録は、根拠に基づく回答の監査可能性を高めます。

実務チェックリスト

  • 引用が実際の文を裏付けているか確認します
  • 文書のバージョンと収集時刻を保存します
  • 削除・変更された出典の取り扱い方針を定めます
  • 失敗・結果なし・権限エラーの状態を成功と区別します
  • 変更の前後を同じ条件で再検証します

研究と公式文書

参考文書は、原理や推奨事項の根拠となるものです。検索結果への表示、AIによる言及、順位、売上を保証するものではありません。実際の適用効果は、サービスのデータを用い、同一条件で観測して確認する必要があります。

この技術についてさらに読む

月ごとのサンプル、引用率の分母、競合の基準点、Goalの達成率を区別します。

記事一覧