SAG / ARCHITECTURE NOTE

キャプチャ・OCR・DOMの境界:画面からどこまで診断できるのか?

画像とテキスト・DOMを、異なる種類の証拠として管理する方法です。画面に製品の説明が表示されていても、メタタグやcanonicalは確認できません。キャプチャをHTML診断と同じ根拠として扱うと、確認していない技術項目について結論を出してしまいます。

Markdownをダウンロード

複数の収集根拠とは何か?

画像とテキスト・DOMを、異なる種類の証拠として管理する方法です。 このノートでは、複数の収集根拠を機能名ではなく、入力・変換・出力それぞれの責務として捉えます。分析結果を信頼するには、どの資料が入力され、何を確認し、どこまで結論を出せるのかが一貫していなければなりません。

なぜこの技術が必要なのか?

画面に製品の説明が表示されていても、メタタグやcanonicalは確認できません。キャプチャをHTML診断と同じ根拠として扱うと、確認していない技術項目について結論を出してしまいます。

設計原則とデータフロー

キャプチャは表示されている文言や構造を確認するための根拠として、DOMとHTMLは技術的なシグナルの確認に使用します。OCRの結果は、元の画像と照合する検証段階が必要です。

許可されたキャプチャ → テキストの抽出・照合 → 根拠の種類に応じた診断

各段階では、前段階の成功を次段階の成果として言い換えてはなりません。資料の識別子、期間、検証状態を一貫して記録すれば、欠落やエラーが発生した場所を特定し、再確認する範囲を決められます。

SAGアーキテクチャとの関連

SAGのキャプチャ診断では、画面上のテキストと引用根拠を確認するとともに、HTMLソースの確認が必要なSEO項目を区別します。キャプチャそのものを、実際のAI引用の観測結果として扱うことはありません。

SAGの運用上の価値は、この関係をページや質問、比較結果、改善作業へと結び付けることにあります。顧客は数値だけを見るのではなく、補強すべき対象と判断根拠を合わせて確認できます。追加適用が必要なパターンについては、該当段落の範囲を基準に読み取る必要があります。

説明用の例と判断基準

説明用の例として、キャプチャからカスタマーサポートの文言は確認できますが、robotsメタタグの有無は確認できません。画面上の根拠とソース上の根拠を分ければ、不足している資料を正確に求められます。

上記の例は構造と計算を説明するためのものであり、特定の顧客企業で測定された成果ではありません。実際のレポートでは、選択した期間・対象・観測条件を原記録と結び付けることで、同じ判断を再確認できるようにする必要があります。

実務検証チェックリスト

フロー段階確認項目
許可されたキャプチャ画像とDOMの証拠タイプの区別
テキストの抽出・照合OCRとキャプチャ内の原文との照合
根拠の種類に応じた診断ソース専用の診断は未確認と表示

正常な入力だけでなく、空の資料、重複した資料、条件の異なる資料でも同じ意味が保たれるかを確認してください。検証項目を作業完了の基準に結び付けると、機能の説明と実際の運用との違いを縮められます。

限界と適用時の注意点

OCRの誤認識、画像内の表、画面の切り抜きによって解釈の誤りが生じることがあります。収集の成功と、診断可能な範囲を同時に表示する必要があります。

研究と公式ドキュメント

外部資料は上記の設計テーマの背景を示すものであり、SAGのすべての実装や顧客の成果を証明するものではありません。このノートにおける適用の解釈と説明用の例は、SAGの運用構造を基準に整理しました。資料確認日:2026-10-06。

関連記事と機能の確認

この技術を読み進める方法

HTML ZIP・サイトマップ → 正規化 → ページバージョン → 根拠の記録、の流れをたどります。

記事一覧