AI・機械学習
中級

Arena-Hard(アリーナハード)

Chatbot Arenaの実ユーザー会話から選出した500問の難問セットを使いLLMの性能をGPT-4-0314との勝率で評価するベンチマーク。LMSYS Orgが2024年公開。

0 回閲覧
0 いいね
2026/5/24 更新
関連タグ
LLMベンチマーク
勝率評価
Chatbot Arena
GPT-4評価
AI性能比較

Arena-Hard とは

Arena-Hard は、2024年にLMSYS Org(Berkeley / CMU / UCSD 共同研究組織)が開発・公開したLLM評価ベンチマークです。人気評価プラットフォーム「Chatbot Arena」の実ユーザー会話データから特に難しい問題を精選した500問セットを使い、モデルの実用的な性能を測定します。

最大の特徴はGPT-4 Turboをジャッジモデルとして使用した「勝率」ベースの評価です。対象モデルの回答とGPT-4-0314の回答を比較させ、「どちらが優れているか」を判定。この勝率(Win Rate)が最終スコアとなります。GPT-4-0314を50%のベースラインとして設定しており、スコアが50%を超えればGPT-4-0314より高性能と解釈できます。

設計思想と技術的特徴

Arena-Hard の前身は MT-Bench(80問・GPT-4ジャッジ)ですが、以下の観点で大幅に強化されています:

  • 問題数: 80問 → 500問(統計的信頼性向上)
  • 問題品質: 研究者作成 → 実ユーザー会話からの自動抽出
  • 難易度: 意図的に困難な問題を選別(技術・論理推論・創作など)
  • ジャッジモデル: GPT-4 → GPT-4 Turbo(より高精度な判定)
  • 相関係数: Chatbot Arena ELOスコアとの相関が0.90以上(MT-Benchの0.82より高い)

2024–2025年 主要モデル勝率

モデルArena-Hard 勝率公開日
o3 mini88.2%2025年
Claude 3.5 Sonnet v285.7%2024年10月
DeepSeek-V2.576.2%2024年
Claude 3.5 Sonnet77.0%2024年6月
GPT-4o75.4%2024年5月
Qwen2.5 72B Instruct71.8%2024年
Gemini 1.5 Pro72.0%2024年
Mistral Large 245.3%2024年
GPT-4o mini47.0%2024年
Llama 3.1 70B Instruct42.5%2024年

50%を下回るモデルはGPT-4-0314より弱いと判定されます。

問題の種類と難易度分布

500問の内訳:

  • コーディング・デバッグ: 約25%(Python/C++/SQLなど)
  • 数学・論理推論: 約20%(数式・証明・パズル)
  • 長文理解・要約: 約15%(論文・ドキュメント解析)
  • 創作・文章生成: 約15%(物語・詩・レポート)
  • 指示追従・タスク実行: 約15%(複数制約付き指示)
  • 事実確認・知識問題: 約10%

これらはすべてChatbot Arenaの実ユーザーが投稿した本物の質問であり、「現実に人が困った問題」という点でベンチマークとしての実用性が高いとされています。

Chatbot Arena ELOとの関係

Arena-HardはChatbot Arena(オンライン人間評価プラットフォーム)と高い相関を持ちます。Chatbot Arenaはリアルタイムに人間がA/Bテストを行うELOレーティング方式ですが、大量の評価が必要で時間・コストがかかります。Arena-HardはChatbot Arena ELOと0.90+の相関を持ちながら、わずか500問・LLMジャッジで完結するため、研究開発サイクルの高速化に貢献しています。

評価の実施方法

# LMSYS公式リポジトリでの実行例
git clone https://github.com/lm-sys/arena-hard-auto
cd arena-hard-auto
python gen_model_answer.py --model-path meta-llama/Meta-Llama-3.1-70B-Instruct \
  --model-id llama-3.1-70b --bench-name arena-hard-v0.1

よくある質問(FAQ)

Q1: Arena-HardとChatbot Arenaはどう違いますか? A: Chatbot Arenaは人間がリアルタイムに評価する動的プラットフォームで信頼性が高い一方、費用・時間がかかります。Arena-Hardは500問・LLMジャッジで迅速に評価できる静的ベンチマークです。相関係数0.90以上で両者は整合しています。

Q2: スコア75%のモデルはGPT-4-0314より25%優れているということですか? A: 「75%の確率でGPT-4-0314より良い回答をする」という意味です。絶対的な能力差のパーセンテージではなく、一対比較の勝率です。

Q3: Arena-Hard v0.1とv1.0の違いは何ですか? A: v0.1は2024年初公開版で500問・GPT-4 Turboジャッジ。v1.0以降はより多くの問題追加・ジャッジモデル更新が予定されています。現在(2025年)もv0.1が主流です。

まとめ

  • 500問・GPT-4 Turboジャッジ・勝率ベースのLLM実用性評価ベンチマーク
  • Chatbot Arena ELOとの相関0.90+を誇る高信頼指標
  • Claude 3.5 Sonnet v2(85.7%)、o3 mini(88.2%)が最高水準
  • 開発サイクル短縮と実用的難問評価の両立で業界標準化が進行中
この記事について
カテゴリーAI・機械学習
難易度中級
作成日2026/5/24