AI・機械学習
中級

Instruction Tuning(指示チューニング)(インストラクションチューニング)

大規模言語モデルに「指示に従って応答する」能力を付与するファインチューニング手法。人間が作成した指示-応答ペアのデータセットで教師あり学習を行い、ゼロショットでの指示追従性を大幅に向上させる。FLAN、InstructGPT、Alpaca等の先駆的研究で実用性が実証され、現代のLLMの標準的な訓練ステップとなっている。

0 回閲覧
0 いいね
2026/6/20 更新
関連タグ
Instruction Tuning
指示チューニング
FLAN
InstructGPT
Alpaca
SFT
教師あり学習

Instruction Tuningとは

Instruction Tuning(指示チューニング)は、大規模言語モデル(LLM)に「自然言語の指示に従って応答する」能力を付与するファインチューニング手法である。事前学習だけでは「次のトークンを予測する」能力しか持たないLLMを、「ユーザーの指示を理解し適切に応答する」対話型AIに変換する。

事前学習との違い

段階目的データ学習目標
事前学習(Pre-training)言語知識の獲得大規模テキストコーパス(数兆トークン)次トークン予測
Instruction Tuning指示追従能力の獲得指示-応答ペア(数万〜数百万件)指示に対する適切な応答生成
RLHF人間の好みへの適合人間の比較評価データ報酬最大化

主要な研究・モデル

モデル/研究年開発元データセット規模特徴
FLAN2022Google62タスク・473Kサンプルマルチタスク指示チューニングの先駆
InstructGPT2022OpenAI約13Kデモ + 33K比較SFT + RLHF の3段階パイプライン
FLAN-T5/PaLM2022Google1,800+タスクタスク数スケーリング実証
Alpaca2023Stanford52K(GPT-3.5生成)低コスト合成データアプローチ
Vicuna2023LMSYS70K(ShareGPT由来)ユーザー対話データ活用
Orca2023Microsoft5M(GPT-4推論トレース)推論過程の模倣学習

データセットの構成

Instruction Tuningデータセットは通常3つの要素で構成される:

  1. 指示(Instruction): ユーザーが達成したいタスクの記述
  2. 入力(Input): タスクに必要な追加コンテキスト(省略可能)
  3. 出力(Output): 指示に対する期待される応答

データ品質の重要性

LIMA論文(Zhou et al., 2023)は「1,000件の高品質データでGPT-4に匹敵する応答品質を達成できる」ことを示し、データの質が量より重要であることを実証した。

アプローチデータ量データ品質性能
Alpaca52K中(GPT-3.5自動生成)中
LIMA1K最高(人手厳選)高
Orca5M高(GPT-4推論トレース)最高

合成データによるInstruction Tuning

高品質な人手データの収集はコストが高いため、強力なLLM(GPT-4等)を教師モデルとして合成データを生成するアプローチが主流:

手法教師モデル生成方法特徴
Self-InstructGPT-3シード指示から自己増殖最初の自動生成アプローチ
AlpacaGPT-3.5175シードから52K生成$500以下のコスト
Evol-InstructGPT-4指示の段階的複雑化WizardLMの基盤
MagpieLlama 3モデル自身から抽出外部教師不要

FAQ

Q1: Instruction TuningとSFT(Supervised Fine-Tuning)の違いは?

SFTは教師ありファインチューニングの総称で、Instruction TuningはSFTの一種。SFTが特定タスクのデータで学習するのに対し、Instruction Tuningは多様なタスクの「指示-応答」ペアで学習し、未知のタスクへのゼロショット汎化を目指す。

Q2: Instruction Tuningだけで十分か、RLHFも必要か?

Instruction Tuningだけでも高品質な応答は可能だが、RLHFを追加すると安全性・丁寧さ・指示追従の精度がさらに向上する。ChatGPTはSFT→RLHFの2段階、Claude はConstitutional AI(CAI)を採用している。

Q3: 自分のドメインデータでInstruction Tuningするには?

  1. ドメイン固有の指示-応答ペアを100〜10,000件作成、2) LoRA/QLoRAでベースモデルをファインチューニング、3) 評価・反復。データ作成にはGPT-4等で下書きを生成し、ドメイン専門家がレビュー・修正するパイプラインが効率的。
この記事について
カテゴリーAI・機械学習
難易度中級
作成日2026/6/4