---
title: "RAGのチャンク分割：文書をどれくらい細かく分割すべきか？"
slug: "rag-chunking-strategy"
language: "ja"
tags: ["chunking","sag 기술","아키텍처","검색 ai 연구"]
created: "2026-09-11T00:00:00.000Z"
published: "2026-10-08T09:59:11.640Z"
updated: "2026-10-08T09:59:15.668Z"
sample: false
---

# RAGのチャンク分割：文書をどれくらい細かく分割すべきか？

## 一文での定義

**chunking**とは、長い文書を検索可能な意味単位に分割し、原文の位置と階層を保持するプロセスです。

> 要点：大きすぎるチャンクは無関係な文脈を混在させ、小さすぎるチャンクは条件や例外を失います。文字数だけで分割すると、表、見出し、段落の関係も断ち切られます。

## なぜこの技術が必要なのか？

大きすぎるチャンクは無関係な文脈を混在させ、小さすぎるチャンクは条件や例外を失います。文字数だけで分割すると、表、見出し、段落の関係も断ち切られます。

## 仕組み

まず見出しの階層、段落、表、リストを基準に分割し、その後に長さの制限とoverlapを適用します。各チャンクには、文書・セクション・バージョン・原文の位置をメタデータとして付与します。

設計時に確認するのは精度だけではありません。遅延、コスト、データ境界、更新頻度、失敗時の動作も併せて定義することで、運用時に再現可能な結果が得られます。自動化で確信が持てない値は、0や成功に置き換えず、未測定・要確認の状態にしておくのが安全です。

## SAGの技術との関係

SAGの根拠artifactにchunkを紐付ける場合、レポートから原文のページと該当箇所に戻れる必要があります。現在保存している出典・ハッシュ・バージョンの原則が、その基盤となります。

## 実務チェックリスト

- 文書の構造を優先して分割境界を決める
- 文脈の欠落と重複検索率を併せて測定する
- chunkから原文に戻るリンクを保持する
- 失敗・結果なし・権限エラーの状態を成功と区別する
- 変更前後を同じ条件で再検証する

## 研究と公式文書

- [RAGの原論文](https://arxiv.org/abs/2005.11401)

参考文書は原理と推奨事項の根拠です。検索での露出、AIでの言及、順位、売上を保証するものではありません。実際の適用効果は、サービスのデータと同一条件での観測によって確認する必要があります。

## 選択基準と具体的な適用例

仕様表を数値の行だけ残して切り分けると、単位・製品名・試験条件が失われます。見出しと表のヘッダーを併せて保持し、原文の位置と紐付けてください。すべての文書に適用できる最適なチャンクサイズはなく、文書の種類と評価対象の質問に基づいて選択します。

## SAGでの適用範囲

この記事では、検索AIの研究原理と拡張設計を扱います。SAGのページ収集・根拠記録・レポート検証の構造と関連付けてお読みください。ただし、論文の検索アルゴリズムがすべて運用パイプラインに搭載されているという意味ではありません。適用の有無は、検索モジュール、評価データ、実行記録によって確認します。


## この技術についてさらに読むには

RAG・GraphRAG・Self-RAGの論文と適用条件を比較します。

- [検索AIの拡張原理](/ko/blog?tag=%EA%B2%80%EC%83%89%20AI%20%EC%97%B0%EA%B5%AC)
- [機能ガイドFAQ](/ja/faq)
