RAG (Retrieval-Augmented Generation・2020-)(アールエージー)
LLMのハルシネーションと知識の鮮度問題を解決するため、外部データベースから関連情報を検索し、生成プロセスに統合する技術。最新情報や特定ドメインの知識を動的に参照可能にする。
概要
RAG(Retrieval-Augmented Generation)は、大規模言語モデル(LLM)の静的なパラメータに依存せず、外部の動的な知識ソースを「検索」して回答の根拠として利用するアーキテクチャです。LLM単体では、学習データに含まれない最新のニュースや、企業内部の機密文書、専門的な技術ドキュメントに関する質問に対して、誤った情報を生成(ハルシーネーション)したり、知識不足により回答不能となったりする限界があります。
RAGは、ユーザーのクエリに対して関連性の高い情報をベクトルデータベース等から抽出・抽出し、その内容をプロンプトの一部としてLLMに与えることで、モデルが「参照可能なコンテキスト」として扱うことを可能にします。これにより、モデルの再学習(Fine-tuning)を行うことなく、情報の更新と正確性の担保を低コストかつ高精度に実現できます。
技術構成要素とワークフロー
現代的なRAGシステムは、単なる検索・生成の二段階ではなく、以下の多層的なプロセスで構成されます。
| コンポーネント | 役割 |
|---|---|
| Query Transformation | ユーザーの曖昧な質問を、検索に適した形式へ変換(HyDEやクエリ分解など)。 |
| Embedding Model | テキストを多次元ベクトルに変換し、意味的な類似度を計算可能にする。 |
| Vector Database | 高次元ベクトルデータを格納し、高速な近傍探索(ANN等)を実現する。 |
| Retriever | 検索エンジン。Top-K件の関連ドキュメント・チャンクを抽出する。 |
| Re-ranker | 抽出された候補に対し、Cross-Encoder等を用いて精緻な再順位付けを行う。 |
| Generator (LLM) | 注入されたコンテキストと元のクエリに基づき、最終的な回答を生成する。 |
RAG手法の進化比較
技術の進展に伴い、単純な検索から高度な推論へとパラダイムがシフトしています。
| 手法 | 特徴・アプローチ | 得意とするタスク | 課題 |
|---|---|---|---|
| Standard RAG | 単純なベクトル類似度による検索と生成。 | 短い事実確認、単純なQA。 | 文脈の欠落、複雑な推論不可。 |
| Advanced RAG | Re-ranking, HyDE, Query Decompositionを導入。 | 複雑な質問への対応、精度向上。 | パイプラインの計算コスト増。 |
| GraphRAG | Knowledge Graph(知識グラフ)と検索を統合。 | 構造的な関係性、広範な要約。 | グラフ構築の高度な技術・コスト。 |
| Recursive/RAPTOR | 階層的な文書要約と再帰的処理。 | 長文ドキュメントの全体把握。 | プロセスの複雑化と遅延。 |
関連技術との決定的な違い
RAG vs Fine-tuning (ファインチューニング)
Fine-tuningはモデルの「重み(パラメータ)」を更新して知識を定着させる手法であり、特定の口調や形式の習得には向いていますが、情報の更新頻度が高く、コストも膨大です。対してRAGは「外部メモリ」への参照であるため、データの差し替えが容易で、根拠となるソース(出典)を明示できるという利点があります。
RAG vs Long Context Window (長文コンテキスト拡張)
LLMの入力可能トークン数が増大したことで、大量の文書を一度にプロンプトへ投入する手法も存在します。しかし、コンテキストが肥大化すると「Lost in the Middle(中間情報の無視)」現象や計算コストの増大が発生するため、必要な情報のみを絞り込むRAGとの併用が現在の主流です。
FAQ
Q1: RAGを導入することでハルシネーションは完全にゼロになりますか? A1: 完全にゼロにすることは困難です。検索結果(Retrieved chunks)自体に誤りがある場合や、LLMがコンテキスト内の情報を誤解して解釈する場合があるため、Re-rankerの精度向上や、引用元を明示する仕組みによる検証プロセスが重要となります。
Q2: 検索精度を上げるための最も効果的な手法は何ですか? A2: 近年のトレンドでは、単一の検索ではなく「Query Decomposition(質問の分解)」と「Re-ranking(再順位付け)」の組み合わせが極めて有効です。また、HyDE(Hypothetical Document Embedding)のように、擬似回答を生成してから検索を行う手法も、クエリとドキュメント間の意味的ギャップを埋める手段として注目されています。
Q3: 今後のRAGの進化はどのような方向に向かいますか? A3: 「Agentic RAG」への移行が進んでいます。これは、LLMが単なる生成器ではなく、自律的に「どのツールを使って検索すべきか」「検索結果が不十分なら再度検索し直すべきか」を判断するエージェントとして機能する形態です。また、画像や音声を含むマルチモーダルなデータに対するRAGの統合も重要な研究領域となっています。