AI・機械学習
中級

インストラクションチューニング(インストラクションチューニング)

自然言語の指示(instruction)に従って応答できるようLLMをファインチューニングする手法。指示-応答ペアのデータセットで学習し、汎用的な指示追従能力を獲得させる。

0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
LLM
ファインチューニング
RLHF
instruction following
SFT

インストラクションチューニングとは

インストラクションチューニング(Instruction Tuning)は、事前学習済みLLMに「指示に従う能力」を付与するファインチューニング手法。2022年のInstructGPT論文(OpenAI)で注目を集め、現代の指示追従LLMの標準技術となった。

技術的仕組み

学習データ形式

指示(Instruction): 次の文章を日本語に翻訳してください。
入力(Input): The model is learning to follow instructions.
出力(Output): モデルは指示に従うことを学習しています。

Prompt-Response ペアを大量収集し、教師あり学習(Supervised Fine-Tuning / SFT)で学習。

学習プロセス

  1. 事前学習済みベースモデル (LLaMA-3, Mistral, Qwen等) を起点
  2. 指示データセット (数万〜数百万件のinstruction-responseペア) で追加学習
  3. 損失関数: 標準的なNext Token Prediction(出力トークンのみ損失計算)
  4. オプション: RLHF / DPO で更に人間の好みに合わせる

主要データセット (2025年)

データセット件数特徴ライセンス
FLAN 20221,836タスクタスク多様性重視Apache 2.0
Dolly 15K15,000件Databricks作成・高品質CC BY-SA
Open Assistant161,000件多言語・会話ツリーApache 2.0
Alpaca-52K52,000件GPT-3.5生成・LLaMA用CC BY-NC
WizardLM-Evol196K件進化的指示生成要確認
ShareGPT〜900K件実ユーザー会話要確認

有名モデルとの対応

  • InstructGPT / ChatGPT: SFT + RLHF の先駆的実装
  • Stanford Alpaca: LLaMA-7B + 52K GPT-3.5生成データ。$600以下で作成
  • Vicuna-13B: ShareGPTデータ活用。ChatGPTに対する90%品質を主張
  • FLAN-T5: 1,836タスクへの指示チューニング。Google Brain
  • Qwen2.5-Instruct: Alibaba公式Instruct版。多言語指示追従

インストラクションチューニングの限界

  • 事実性向上なし: 指示追従能力は上がるが幻覚(Hallucination)は残る
  • 知識更新なし: 訓練データより新しい情報は答えられない
  • アライメント不完全: 単純なSFTではRLHFなしで有害出力を防げない
  • 過学習リスク: 小規模データでは過学習し汎化性能が低下

Self-Instruct (2023)

Wang et al. (2023) が提案した自動指示データ生成フレームワーク。既存LLMに自己生成させた指示データでブートストラップ学習する。Alpacaも本手法でデータ作成。2025年現在、合成データ生成の主流手法となっている。

RLHFとの関係

RLHF(Reinforcement Learning from Human Feedback)はインストラクションチューニング(SFT)の後段に位置する。SFTで基本的な指示追従を習得→RLHFで人間の好みにさらに整合する二段構成が標準的。

よくある質問 (FAQ)

Q1: LoRAとインストラクションチューニングの関係は? A: 直交する概念。インストラクションチューニングは「何で学習するか(タスク設定)」、LoRAは「どう学習するか(パラメータ更新方法)」。組み合わせてLoRAによるInstruction Tuningが可能。

Q2: インストラクションチューニングに必要な最小データ量は? A: 高品質データ1,000〜10,000件で効果が出る事例あり。ただしカバレッジの広い指示多様性が重要で、均一なタスクの大量データより多様な少量データの方が汎化性能が高い傾向。

Q3: 日本語のInstruction Tuningデータセットは? A: Japanize-Alpaca(Alpaca翻訳版)、ichikara-instruction(国立情報学研究所)、Swallow Corpus(東工大)など。2025年現在、日本語高品質データは英語比で依然少ない。

まとめ

  • 事前学習済みLLMに「指示追従能力」を付与する必須技術
  • 学習データ: 指示-応答ペア(数万〜数百万件)
  • RLHFの前段SFTとして標準的に使用
  • 2025年現在、GPT-4o/Claude/Geminiすべてに適用済み
この記事について
カテゴリーAI・機械学習
難易度中級
作成日2026/6/6