AI・機械学習
上級

IFEval(アイエフイーバル)

Google Researchが開発したLLMの指示追従(Instruction Following)能力を評価するベンチマーク。「回答を300語以内で」「箇条書き5項目で」「JSONフォーマットで」等の25種類の検証可能な制約を含む541のプロンプトで、LLMが指示を正確に守れるかを客観的に測定する。

0 回閲覧
0 いいね
2026/6/20 更新
関連タグ
LLMベンチマーク
指示追従
Instruction Following
IFEval
Google Research
制約充足

IFEvalとは

IFEval(Instruction-Following Eval)は、Google Researchが2023年11月に公開したLLM評価ベンチマークである。「LLMが人間の指示をどれだけ正確に守れるか」を、プログラム的に検証可能な制約を使って客観的に測定する。541のプロンプトに25種類の検証可能な制約(Verifiable Instruction)を埋め込み、回答が各制約を満たしているかを自動チェックする。

検証可能な制約(Verifiable Instructions)

IFEvalの核心は、LLMの回答が指示を守っているかをプログラムで自動判定できる25種類の制約。以下は代表的なもの。

フォーマット制約

制約ID制約内容検証方法
json_format回答をJSON形式で出力JSONパース成功判定
markdown_formatMarkdownテーブルを含める正規表現マッチ
bullet_list箇条書きN項目で回答リスト要素数カウント
numbered_list番号付きリストで回答番号付きリスト検出
title_caseタイトルケースで記述大文字・小文字パターン検証

長さ制約

制約ID制約内容検証方法
num_wordsN語以内/以上で回答ワードカウント
num_sentencesN文以内/以上で回答文分割カウント
num_paragraphsN段落で回答段落分割カウント

含有制約

制約ID制約内容検証方法
include_keyword特定キーワードを含める文字列検索
exclude_keyword特定キーワードを含めない文字列不在確認
frequency特定語をN回使用出現頻度カウント
postscript追伸(P.S.)を末尾に付ける末尾パターン検出

スタイル制約

制約ID制約内容検証方法
no_commaカンマを使わない文字不在確認
all_uppercase全て大文字で回答文字種判定
all_lowercase全て小文字で回答文字種判定
language特定言語で回答言語検出

評価メトリクス

IFEvalは4つのメトリクスでスコアを算出する。

メトリクス単位説明
Prompt-Level Strictプロンプト1つのプロンプト内の全制約を満たした割合
Prompt-Level Looseプロンプト各制約に若干の許容幅を持たせた判定
Instruction-Level Strict個別制約全制約の充足率(個別カウント)
Instruction-Level Loose個別制約許容幅ありの個別制約充足率

Strict vs Loose: Looseモードでは、たとえば「300語以内」の制約に±10%の許容幅(330語まで可)を設ける。Strictは厳密に300語以内のみ合格。

主要モデルのスコア比較

モデルPrompt-StrictPrompt-LooseInst-StrictInst-Loose
GPT-4o83.4%86.7%88.1%90.5%
Claude 3.5 Sonnet86.1%89.2%90.3%92.1%
Gemini 1.5 Pro80.2%83.5%85.4%87.8%
Llama 3.1 70B77.8%81.3%83.2%85.9%
Mistral Large 273.5%77.1%79.8%82.4%

実務での重要性

指示追従能力は以下の実用シナリオに直結する。

  • 構造化出力生成: JSONやCSV等の特定フォーマットでの出力(API連携に必須)
  • コンテンツ制作: 「800字以内の記事」「5項目の箇条書き」等の編集制約の順守
  • 多言語対応: 「日本語で回答」「英語のみ使用」等の言語制約
  • プロンプトエンジニアリング: 複数の制約を組み合わせた複雑な指示への対応力
  • AIエージェント: ツール呼び出しの出力フォーマット制約の順守

他ベンチマークとの補完関係

ベンチマーク評価対象IFEvalとの関係
MMLU-Pro学術知識・推論知識面を補完
Arena-Hard対話品質品質面を補完
LiveBench汚染フリー総合LiveBenchの指示追従カテゴリはIFEval派生
BFCL関数呼び出しツール利用の制約面を補完

よくある質問(FAQ)

Q1: IFEvalのスコアが高いモデルは日本語でも指示に従う?

A: IFEvalは英語のみの評価。日本語での指示追従能力は別途検証が必要。ただし英語でのIFEvalスコアが高いモデルは、日本語でも制約順守傾向が強い経験則がある。

Q2: 指示追従と回答品質は別?

A: 別である。IFEvalは「形式的な制約を守れるか」だけを測定。回答の内容の正確性・有用性はMMLU-ProやArena-Hard-Autoで評価する。形式は完璧だが内容が薄い回答でも、IFEvalでは高スコアになり得る。

Q3: プロンプトエンジニアリングでIFEvalスコアを改善できる?

A: 一定程度は可能。「以下の制約を厳密に守ってください」等のメタ指示を追加するとスコアが向上するモデルもある。ただしIFEvalはモデル本体の能力を測るベンチマークであり、プロンプトの追加は公式評価では行わない。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/20