Arena-Hard(アリーナハード)
Chatbot Arenaの実ユーザー会話から選出した500問の難問セットを使いLLMの性能をGPT-4-0314との勝率で評価するベンチマーク。LMSYS Orgが2024年公開。
Arena-Hard とは
Arena-Hard は、2024年にLMSYS Org(Berkeley / CMU / UCSD 共同研究組織)が開発・公開したLLM評価ベンチマークです。人気評価プラットフォーム「Chatbot Arena」の実ユーザー会話データから特に難しい問題を精選した500問セットを使い、モデルの実用的な性能を測定します。
最大の特徴はGPT-4 Turboをジャッジモデルとして使用した「勝率」ベースの評価です。対象モデルの回答とGPT-4-0314の回答を比較させ、「どちらが優れているか」を判定。この勝率(Win Rate)が最終スコアとなります。GPT-4-0314を50%のベースラインとして設定しており、スコアが50%を超えればGPT-4-0314より高性能と解釈できます。
設計思想と技術的特徴
Arena-Hard の前身は MT-Bench(80問・GPT-4ジャッジ)ですが、以下の観点で大幅に強化されています:
- 問題数: 80問 → 500問(統計的信頼性向上)
- 問題品質: 研究者作成 → 実ユーザー会話からの自動抽出
- 難易度: 意図的に困難な問題を選別(技術・論理推論・創作など)
- ジャッジモデル: GPT-4 → GPT-4 Turbo(より高精度な判定)
- 相関係数: Chatbot Arena ELOスコアとの相関が0.90以上(MT-Benchの0.82より高い)
2024–2025年 主要モデル勝率
| モデル | Arena-Hard 勝率 | 公開日 |
|---|---|---|
| o3 mini | 88.2% | 2025年 |
| Claude 3.5 Sonnet v2 | 85.7% | 2024年10月 |
| DeepSeek-V2.5 | 76.2% | 2024年 |
| Claude 3.5 Sonnet | 77.0% | 2024年6月 |
| GPT-4o | 75.4% | 2024年5月 |
| Qwen2.5 72B Instruct | 71.8% | 2024年 |
| Gemini 1.5 Pro | 72.0% | 2024年 |
| Mistral Large 2 | 45.3% | 2024年 |
| GPT-4o mini | 47.0% | 2024年 |
| Llama 3.1 70B Instruct | 42.5% | 2024年 |
50%を下回るモデルはGPT-4-0314より弱いと判定されます。
問題の種類と難易度分布
500問の内訳:
- コーディング・デバッグ: 約25%(Python/C++/SQLなど)
- 数学・論理推論: 約20%(数式・証明・パズル)
- 長文理解・要約: 約15%(論文・ドキュメント解析)
- 創作・文章生成: 約15%(物語・詩・レポート)
- 指示追従・タスク実行: 約15%(複数制約付き指示)
- 事実確認・知識問題: 約10%
これらはすべてChatbot Arenaの実ユーザーが投稿した本物の質問であり、「現実に人が困った問題」という点でベンチマークとしての実用性が高いとされています。
Chatbot Arena ELOとの関係
Arena-HardはChatbot Arena(オンライン人間評価プラットフォーム)と高い相関を持ちます。Chatbot Arenaはリアルタイムに人間がA/Bテストを行うELOレーティング方式ですが、大量の評価が必要で時間・コストがかかります。Arena-HardはChatbot Arena ELOと0.90+の相関を持ちながら、わずか500問・LLMジャッジで完結するため、研究開発サイクルの高速化に貢献しています。
評価の実施方法
# LMSYS公式リポジトリでの実行例
git clone https://github.com/lm-sys/arena-hard-auto
cd arena-hard-auto
python gen_model_answer.py --model-path meta-llama/Meta-Llama-3.1-70B-Instruct \
--model-id llama-3.1-70b --bench-name arena-hard-v0.1
よくある質問(FAQ)
Q1: Arena-HardとChatbot Arenaはどう違いますか? A: Chatbot Arenaは人間がリアルタイムに評価する動的プラットフォームで信頼性が高い一方、費用・時間がかかります。Arena-Hardは500問・LLMジャッジで迅速に評価できる静的ベンチマークです。相関係数0.90以上で両者は整合しています。
Q2: スコア75%のモデルはGPT-4-0314より25%優れているということですか? A: 「75%の確率でGPT-4-0314より良い回答をする」という意味です。絶対的な能力差のパーセンテージではなく、一対比較の勝率です。
Q3: Arena-Hard v0.1とv1.0の違いは何ですか? A: v0.1は2024年初公開版で500問・GPT-4 Turboジャッジ。v1.0以降はより多くの問題追加・ジャッジモデル更新が予定されています。現在(2025年)もv0.1が主流です。
まとめ
- 500問・GPT-4 Turboジャッジ・勝率ベースのLLM実用性評価ベンチマーク
- Chatbot Arena ELOとの相関0.90+を誇る高信頼指標
- Claude 3.5 Sonnet v2(85.7%)、o3 mini(88.2%)が最高水準
- 開発サイクル短縮と実用的難問評価の両立で業界標準化が進行中