ELYZA TASKS 100(イライザタスクヒャク)
ELYZAが公開した日本語LLM評価ベンチマーク。要約・翻訳・創作・コード生成など実用的な指示追従100問を人手評価し、日本語モデルの実力をGPT-4と比較する。
ELYZA TASKS 100とは
ELYZA TASKS 100(イライザ・タスクズ・ヒャク)は、日本のAIスタートアップELYZA株式会社が2023年に公開した日本語LLM評価ベンチマークです。従来の選択式・抽出式ベンチマーク(JGLUEなど)では測定できない自由生成タスクの品質を、実際のユーザー視点で多面的に評価するために設計されました。
100問の構成と評価方式
100問は4カテゴリに分類されています。
- 要約・翻訳(約25問):長文要約・和英/英和翻訳・箇条書き整理など
- 質問応答・情報抽出(約25問):事実確認・計算問題・日常的な知識応答
- 創作・文章生成(約25問):短編小説・詩作・メール文章作成・広告コピー生成
- コード生成・数理推論(約25問):Pythonコード生成・バグ修正・簡易アルゴリズム実装
評価は人手による5段階採点(1:不正確/有害 〜 5:完全に正確・有用)で行い、GPT-4の回答を参照回答として使用します。得点はタスク毎に集計し、GPT-4スコアに対する相対値で比較されることが多いです。
日本語LLM評価への影響
ELYZA TASKS 100の公開は日本語LLM評価に大きなインパクトをもたらしました。ELYZA-japanese-Llama-2-70b-instructがGPT-3.5-turboに迫るスコアを記録したことが大きな話題となり、オープンソース日本語LLMの実力が広く認知されるきっかけになりました。テスト問題が公開されているため研究者が独自モデルを評価・比較できる点も普及の要因です。
JGLUEとの比較
JGLUEがNLU中心の選択式タスクであるのに対し、ELYZA TASKS 100は実用的な指示追従と生成品質を測定します。両者は補完関係にあり、JGLUE高スコア+ELYZA TASKS 100高スコアのモデルは日本語NLU・NLG両面で優れた能力を持つと判断できます。
2025年における位置づけ
GPT-4oやGemini 1.5 Proの登場により、最上位モデルはほぼ満点近くを記録するため、ベンチマークの識別力が低下しつつあります。2025年時点では、より難易度の高いELYZA TASKS 100 v2の開発や、Nejumi Leaderboard NEOでの統合評価など、次世代評価フレームワークへの移行が進んでいます。また東京大学や理化学研究所など学術機関との協力による新規評価タスク整備も継続されており、日本語LLM評価の高度化に貢献しています。