AI・機械学習
上級
Arena-Hard(アリーナハード)
LMSYSが開発したLLM評価ベンチマーク。500問の難問セットで複数モデルを自動対戦形式で比較し、勝率ベースでランキングする。MT-Benchより識別力が高い。
0 回閲覧
0 いいね
2026/5/24 更新
関連タグ
ベンチマーク
LLM評価
自動評価
ELO
Arena-Hard とは
Arena-Hard は、UC Berkeley の LMSYS チームが 2024 年 5 月に公開した LLM 評価ベンチマークです。従来の Chatbot Arena(主観的な人間評価)の問題点を補い、500 問の難問セットとGPT-4o による自動審判を組み合わせて、再現性のある客観的評価を実現します。
MT-Bench(80 問)よりも 6 倍多い問題数と、より難易度の高い問題構成により、モデル間の差異をより明確に識別できるのが特徴です。
主な特徴・仕組み
- 問題数: 500 問(コーディング・数学・論理・クリエイティブライティング等)
- 審判モデル: GPT-4o(gpt-4o-2024-05-13)が各回答を評価
- 評価方式: ペアワイズ比較(A vs B)→ Bradley-Terry モデルで ELO スコア算出
- ベースライン: GPT-4-0314 のスコアを 0 として相対比較
- 識別力: Chatbot Arena の実際の ELO と相関係数 0.94 以上(MT-Bench は 0.86)
- 再現性: 同じ条件で再実行すれば同一結果が得られる
- オープンソース: GitHub で問題セット・評価コード公開済み
スコア比較表(2025 年 3 月時点)
| モデル | Arena-Hard スコア | 特徴 |
|---|---|---|
| Claude 3.5 Sonnet (2024-10-22) | 79.4 | コーディング・推論で優秀 |
| GPT-4o (2024-11-20) | 77.2 | バランス型 |
| Gemini 1.5 Pro (002) | 72.0 | 多言語・長文対応 |
| Llama 3.1 405B Instruct | 69.3 | オープンソース最高峰 |
| Claude 3 Opus | 60.4 | 旧世代 Opus |
| GPT-3.5 Turbo | 37.1 | ベースライン参考値 |
MT-Bench との違い
| 項目 | Arena-Hard | MT-Bench |
|---|---|---|
| 問題数 | 500 問 | 80 問 |
| 評価方式 | ペアワイズ比較 | 1-10 点スコア |
| 識別力 | 高(相関 0.94) | 中(相関 0.86) |
| 実行コスト | 中($~$50/モデル) | 低($~$8/モデル) |
| 公開年 | 2024 年 | 2023 年 |
問題カテゴリ構成
- コーディング: 約 35%(アルゴリズム・デバッグ・API 設計)
- 数学・定量推論: 約 25%(微積分・確率・最適化)
- 論理推論: 約 20%(パズル・演繹推論)
- クリエイティブライティング: 約 10%
- その他指示従い: 約 10%
利用方法(研究者・開発者向け)
# リポジトリクローン
git clone https://github.com/lm-sys/arena-hard-auto
# 独自モデルの評価実行
python gen_answer.py --model <your_model> --api-base http://localhost:8000/v1
# GPT-4o 審判による比較評価
python gen_judgment.py --model-list <your_model> --baseline gpt-4-0314
# スコア計算
python show_result.py
選び方・注意点
- コスト: GPT-4o を審判に使うため、500 問評価で API コスト約 $50 が発生
- バイアス: GPT-4o 系モデルに有利になる可能性がある
- 日本語評価には不向き: 問題は英語のみ
- 最新版: arena-hard-v0.1(500 問)が現行版
よくある質問(FAQ)
Q1: Arena-Hard のスコアが高いモデルは実際に使いやすいですか? A: コーディングや推論タスクには高い相関があります。ただし日本語対話や創造的タスクでは別途評価が必要です。
Q2: 無料で自分のモデルを評価できますか? A: 問題セット・評価コードは無料ですが、GPT-4o 審判に API コスト(約 $50/評価)が発生します。
Q3: Chatbot Arena と Arena-Hard はどちらが正確ですか? A: Chatbot Arena(数万票の人間評価)の方が最終的な精度は高いですが、Arena-Hard は数時間で同等の識別力を得られます。
まとめ
- 500 問・GPT-4o 審判による再現性の高い LLM 自動評価ベンチマーク
- MT-Bench より識別力が高く、Chatbot Arena との相関 0.94
- 2024 年以降、学術・産業界で LLM 比較の主要指標として定着