AI・機械学習
上級

Arena-Hard(アリーナハード)

LMSYSが開発したLLM評価ベンチマーク。500問の難問セットで複数モデルを自動対戦形式で比較し、勝率ベースでランキングする。MT-Benchより識別力が高い。

0 回閲覧
0 いいね
2026/5/24 更新
関連タグ
ベンチマーク
LLM評価
自動評価
ELO

Arena-Hard とは

Arena-Hard は、UC Berkeley の LMSYS チームが 2024 年 5 月に公開した LLM 評価ベンチマークです。従来の Chatbot Arena(主観的な人間評価)の問題点を補い、500 問の難問セットとGPT-4o による自動審判を組み合わせて、再現性のある客観的評価を実現します。

MT-Bench(80 問)よりも 6 倍多い問題数と、より難易度の高い問題構成により、モデル間の差異をより明確に識別できるのが特徴です。

主な特徴・仕組み

  • 問題数: 500 問(コーディング・数学・論理・クリエイティブライティング等)
  • 審判モデル: GPT-4o(gpt-4o-2024-05-13)が各回答を評価
  • 評価方式: ペアワイズ比較(A vs B)→ Bradley-Terry モデルで ELO スコア算出
  • ベースライン: GPT-4-0314 のスコアを 0 として相対比較
  • 識別力: Chatbot Arena の実際の ELO と相関係数 0.94 以上(MT-Bench は 0.86)
  • 再現性: 同じ条件で再実行すれば同一結果が得られる
  • オープンソース: GitHub で問題セット・評価コード公開済み

スコア比較表(2025 年 3 月時点)

モデルArena-Hard スコア特徴
Claude 3.5 Sonnet (2024-10-22)79.4コーディング・推論で優秀
GPT-4o (2024-11-20)77.2バランス型
Gemini 1.5 Pro (002)72.0多言語・長文対応
Llama 3.1 405B Instruct69.3オープンソース最高峰
Claude 3 Opus60.4旧世代 Opus
GPT-3.5 Turbo37.1ベースライン参考値

MT-Bench との違い

項目Arena-HardMT-Bench
問題数500 問80 問
評価方式ペアワイズ比較1-10 点スコア
識別力高(相関 0.94)中(相関 0.86)
実行コスト中($~$50/モデル)低($~$8/モデル)
公開年2024 年2023 年

問題カテゴリ構成

  • コーディング: 約 35%(アルゴリズム・デバッグ・API 設計)
  • 数学・定量推論: 約 25%(微積分・確率・最適化)
  • 論理推論: 約 20%(パズル・演繹推論)
  • クリエイティブライティング: 約 10%
  • その他指示従い: 約 10%

利用方法(研究者・開発者向け)

# リポジトリクローン
git clone https://github.com/lm-sys/arena-hard-auto

# 独自モデルの評価実行
python gen_answer.py --model <your_model> --api-base http://localhost:8000/v1

# GPT-4o 審判による比較評価
python gen_judgment.py --model-list <your_model> --baseline gpt-4-0314

# スコア計算
python show_result.py

選び方・注意点

  • コスト: GPT-4o を審判に使うため、500 問評価で API コスト約 $50 が発生
  • バイアス: GPT-4o 系モデルに有利になる可能性がある
  • 日本語評価には不向き: 問題は英語のみ
  • 最新版: arena-hard-v0.1(500 問)が現行版

よくある質問(FAQ)

Q1: Arena-Hard のスコアが高いモデルは実際に使いやすいですか? A: コーディングや推論タスクには高い相関があります。ただし日本語対話や創造的タスクでは別途評価が必要です。

Q2: 無料で自分のモデルを評価できますか? A: 問題セット・評価コードは無料ですが、GPT-4o 審判に API コスト(約 $50/評価)が発生します。

Q3: Chatbot Arena と Arena-Hard はどちらが正確ですか? A: Chatbot Arena(数万票の人間評価)の方が最終的な精度は高いですが、Arena-Hard は数時間で同等の識別力を得られます。

まとめ

  • 500 問・GPT-4o 審判による再現性の高い LLM 自動評価ベンチマーク
  • MT-Bench より識別力が高く、Chatbot Arena との相関 0.94
  • 2024 年以降、学術・産業界で LLM 比較の主要指標として定着
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/5/24