AI・機械学習
上級

Inspect AI (UK AI Safety Institute Eval Framework・2024年)(インスペクトエーアイ)

2024年5月UK AI Safety Institute (UK AISI・英国政府機関) 発表のInspect AI・OSS LLM Capability/Safety Evaluation framework。Python実装・MIT License・GitHub Star 2k+ (2024年Q4)・国家AI Safety評価機関による公的Eval framework標準化試み・OpenAI/Anthropic/Google DeepMind/Meta等の Frontier LLM Modelの Capability evaluation (Math/Coding/Cybersecurity/CBRN/Persuasion) 実装・Multi-turn / Tool use / Agentic evaluation対応・US AISI / Japan AISI / Singapore IDA等の各国AI Safety機関でも採用検討中の国際標準志向Framework。

0 回閲覧
0 いいね
2026/5/19 更新
関連タグ
llm-evaluation
ai-safety
uk-aisi
inspect-ai
capability-evaluation
frontier-models
open-source

概要

Inspect AI は、2024年5月にUK AI Safety Institute (UK AISI・英国政府2023年11月設立のAI安全機関) が発表したOSS LLM Capability/Safety Evaluation framework。Python実装・MIT License・GitHub Star 2,000+ (2024年Q4)・累計DL 50万+。世界初の「国家AI Safety機関が公式に開発・公開した Frontier Model Evaluation framework」として US AISI (NIST AI Safety Institute)・Japan AISI (経産省AI Safety Institute 2024年2月設立)・Singapore IDA (Infocomm Media Development Authority)・EU AI Office等の各国AI Safety機関でも採用検討中。OpenAI GPT-4o/o1/o3・Anthropic Claude Opus 4・Google Gemini 2.0 Ultra・Meta Llama 4・xAI Grok 3等の Frontier LLM Modelに対して Math / Coding / Cybersecurity / CBRN (Chemical/Biological/Radiological/Nuclear) Knowledge / Persuasion / Agentic Capability の評価を実装。Multi-turn dialogue・Tool use・Agentic browser evaluation・Solver/Scorer pattern等のEval primitive を提供。

主な特徴・仕組み

  • 公的機関製: UK AISI (英国政府機関・予算£100M・スタッフ40+) 開発でNeutral / Vendor-agnostic
  • Frontier Model対応: OpenAI/Anthropic/Google/Meta/xAI/Mistral Frontier LLM全対応・Custom Endpoint対応
  • Eval Categories: Math (MMMU/AIME)・Coding (HumanEval/SWE-bench)・Cybersecurity (CyBench/CTF) ・CBRN・Persuasion・Bias・Hallucination
  • Multi-turn / Agentic: Tool use (Web browser/Code execution/File I/O) + Agentic browser eval (Browser use) + Multi-step task evaluation
  • Solver/Scorer Pattern: Eval task = Sample (input/target) + Solver (LLM call) + Scorer (correctness判定) の declarative構成
  • Sandbox: Code execution isolated sandbox (Docker/Firejail) + Cybersecurity CTF環境構築
  • Inspect View Web UI: Eval結果 + Trace + Sample-level inspection + Log共有
  • Python SDK: pip install inspect-ai + 標準ライブラリ統合・Custom Eval task記述容易

スペック比較表

AI Safety Eval提供機関LicenseFrontier Model
Inspect AIUK AISI英国政府MIT◎ (GPT-4o/Claude 4/Gemini 2.0)
HELM (Stanford)学術Stanford CRFMApache 2.0○
OpenAI EvalsOpenAI純正OpenAIMIT△ (OpenAI中心)
BIG-benchGoogleGoogleApache 2.0○
Anthropic EvalsAnthropicAnthropic非公開△ (Claude中心)

具体例・対応製品

  • UK AISI公式採用: OpenAI/Anthropic/Google DeepMindのFrontier Model Pre-Release Safety Testing標準
  • US AISI連携 (2024年4月MoU): 米英共同のFrontier Model Pre-Deployment Evaluation
  • OpenAI Preparedness Framework協力: GPT-4o/o1/o3のCBRN/Cybersecurity capability evaluation
  • Anthropic Responsible Scaling Policy協力: Claude Opus 4のAutonomy/CBRN evaluation
  • 学術用途: Cambridge/Oxford/MIT/Stanford等のAI Safety研究室の Eval baseline

自作PCでの選び方・注意点

Inspect AI は「Frontier Model Capability/Safety評価」「AI Safety研究」「国家AI規制対応 (EU AI Act / US Executive Order / UK AI Safety Bill 等)」用途の本命公的Framework。Promptfoo/Langfuse等のCommercial向けLLMOpsツールと異なり、AI Safety Research focusで CBRN / Cybersecurity / Autonomy / Persuasion 等のFrontier risk capability評価が中核機能。MIT License・Python実装・SDK完成度高でアカデミック研究者/AI Safetyチームの即時採用可能。一方Commercial LLM Application Evaluation (Customer service chatbot精度等) には機能overkillで Promptfoo / Langfuse / Braintrust 推奨。Sandbox実行のためDocker/Firejail前提・CTF等のEvalは隔離環境必須。UK AISI公式採用Framework保証で 規制対応 (EU AI Act compliance) のEvidence提出にも利用可能。

関連用語との違い

  • vs HELM (Stanford CRFM): 両方学術志向・HELMはBenchmark dataset中心・Inspect AIはEval Framework SDK中心・補完関係
  • vs OpenAI Evals: 両方MIT/Python・Inspect AIはMulti-provider/Frontier対応・OpenAI EvalsはOpenAI中心
  • vs Promptfoo: Inspect AIはAI Safety研究focus・PromptfooはCommercial LLMOps focus・全く別用途

よくある質問(FAQ)

Q1: UK AISIとはどんな機関? A: 2023年11月Bletchley Park AI Safety Summitで設立決定・2024年Q1正式設立した英国政府機関 (旧Frontier AI Taskforce改組)・予算£100M (2024-2025年)・スタッフ40+・OpenAI/Anthropic/Google DeepMindとのMoU締結でFrontier Model Pre-release Safety Testing実施。

Q2: 各国AI Safety Institute間の連携状況は? A: 2024年4月US-UK AISI MoU・2024年5月Seoul AI Safety Summitで10+国国際ネットワーク設立 (Japan/Singapore/Canada/France/Germany/Australia等)・Inspect AI共通frameworkとしての展開検討中。

Q3: Commercial用途 (社内LLM App Eval) に使える? A: 使えるが overkill。Commercial 用途はPromptfoo/Langfuse/Humanloop推奨。Inspect AI採用が活きるのは「AI Safety研究」「Frontier Model監査」「規制対応Evidence準備」のいずれかに該当する場合。

まとめ

Inspect AI = 2024年UK AI Safety Institute発表のOSS LLM Capability/Safety Eval framework。Python/MIT・GitHub 2k Star・国家AI Safety機関製の Vendor-agnostic Eval基盤。Frontier Model (GPT-4o/Claude 4/Gemini 2.0) のMath/Coding/Cybersecurity/CBRN評価が本命用途・各国AI Safety機関標準志向の国際協調Framework。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/5/19