AI・機械学習
上級

InternVL 2 (Shanghai AI Lab 2024)(インターンブイエル2・2024)

Shanghai AI Lab 2024年7月発表 OSS マルチモーダル LLM。1B-108B 派生・GPT-4V 凌駕性能・MIT・中国系最強

0 回閲覧
0 いいね
2026/5/24 更新
関連タグ
LLM
Multimodal
InternVL
Shanghai AI Lab
2024
OSS
1B-108B
MIT
中国系最強
GPT-4V凌駕

概要

InternVL 2 は 2024年7月4日に Shanghai AI Lab(上海人工智能実験室、2020年設立)+ 上海交通大学 + 香港大学 + 清華大学等の研究チームが発表した OSS マルチモーダル LLM ファミリー(HuggingFace: OpenGVLab/InternVL2 シリーズ)。1B-108B 派生(InternVL2-1B/2B/4B/8B/26B/40B/76B/Llama3-76B/Pro 等 9 モデル)・GPT-4V 凌駕性能(MMMU 67.3% / VQAv2 96.4% / ChartQA 87.5%)・MIT ライセンス・中国系 OSS Multimodal の最強モデル。

Shanghai AI Lab は 2020 年に中国政府支援で設立された AI 研究機関で、OpenGVLab(オープンビジョン研究グループ)配下で InternVL シリーズ(InternVL 1.0 2023-12 → 1.5 2024-04 → 2.0 2024-07)を継続開発。InternVL 2 は GPT-4V (2023-09) 公開以降、中国系 OSS Multimodal モデルの最高峰として 2024 年で最も話題になったモデルの一つ。

革新は (1) 9 派生モデル:1B (Mac mini 動作)・2B/4B (エッジ)・8B (RTX 4090)・26B/40B (高性能 GPU)・76B (フル版)・Llama3-76B (Meta Llama 3 ベース)・Pro (中国 API のみ) と幅広いサイズ展開 (2) GPT-4V 凌駕:MMMU・VQA・OCR の主要ベンチマークで商用 GPT-4V を上回り、OSS で初の偉業 (3) Vision Encoder 強化: InternViT-6B(Shanghai AI Lab 独自)で従来 CLIP-ViT より高解像度対応 (4) 動画入力対応:InternVL2 シリーズで動画フレーム解析可。

ライセンス MIT、HuggingFace で無料公開、商用利用可。中国 SenseTime・Alibaba 等で商用採用、グローバル研究コミュニティでも広く利用。

主な特徴・仕組み

  • 派生モデル: 1B/2B/4B/8B/26B/40B/76B/Llama3-76B/Pro 9 種
  • ベース LLM: Qwen / Llama / InternLM の組合せ(モデルで異なる)
  • Vision Encoder: InternViT-6B(Shanghai AI Lab 独自)
  • MMMU: 67.3%(GPT-4V 56.8% を凌駕)
  • VQAv2: 96.4%
  • ChartQA: 87.5%
  • DocVQA: 95.1%
  • OCR Bench: 794
  • 動画入力: 対応(複数フレーム解析)
  • コンテキスト: 8K-32K(モデルで異なる)
  • ライセンス: MIT
  • VRAM: 76B = 152GB FP16・38GB INT4
  • OS バージョン: InternVL2 (2024-07)・InternVL2.5 (2024-12 改良)

スペック比較表

項目InternVL 2-76B (2024)GPT-4oGemini 1.5 ProMolmo 72BNVLM 1.0 72B
パラメータ76Bunknownunknown72B72B
MMMU67.3%69.1%62.2%54.1%59.7%
VQAv296.4%unknownunknown96.3%unknown
ChartQA87.5%unknownunknownunknownunknown
ライセンスMITproprietaryproprietaryApache 2.0MIT
動画入力ありなしありなしなし
派生サイズ1B-108B1 種1 種1B-72B72B のみ

具体例・対応製品

  • OpenGVLab/InternVL2-76B (HuggingFace 2024-07): フル版
  • OpenGVLab/InternVL2-Llama3-76B: Meta Llama 3 ベース版
  • OpenGVLab/InternVL2-8B: RTX 4090 24GB 動作可
  • OpenGVLab/InternVL2-1B: Mac mini M2 動作可
  • InternVL2 Pro (中国 API): 商用 API、$0.5/1M トークン

選び方・注意点

  • OSS Multimodal 最強級: MMMU 67.3% で GPT-4V 凌駕・Gemini 1.5 Pro (62.2%) も上回り、Molmo (54.1%) を圧倒
  • 9 派生モデルサイズ: 用途別最適選択可、1B → スマホ・8B → RTX 4090・76B → 高性能 GPU
  • MIT ライセンス: 商用利用完全自由、Apache 2.0 とほぼ同等の緩いライセンス
  • 動画対応: 複数フレーム解析可、Gemini 1.5 Pro と並ぶ OSS で唯一の動画対応
  • 中国系の地政学リスク: 米国制裁・データ規制対応必要、自社 GPU 推奨
  • 2024-12 InternVL 2.5 改良: 性能向上 + 動画長文対応強化、新規利用は 2.5 推奨
  • Pro 版(商用 API): Shanghai AI Lab 直 API、$0.5/1M で破格コスパ

関連用語との違い

用語違い
InternVL 2 (Shanghai AI Lab 2024)OSS 1B-108B・MIT・GPT-4V 凌駕
GPT-4o (OpenAI 2024)商用・音声統合
Gemini 1.5 Pro (2024)1M-2M context・動画
Molmo (Allen AI 2024)OSS 72B・Apache 2.0
NVLM (NVIDIA 2024)OSS NVIDIA 戦略 72B

よくある質問(FAQ)

Q1: GPT-4V 凌駕の意味は? A: 2023-09 公開 GPT-4V(GPT-4 with Vision)は当時の Multimodal LLM 絶対王者、OSS で MMMU 56.8% を超えるのは不可能と思われていた。InternVL 2-76B が 2024-07 に MMMU 67.3% で 10 ポイント以上の差を付けて凌駕、「OSS が商用最強モデルを超える」中国系 AI 研究の象徴的成果。

Q2: 9 派生モデルの使い分けは? A: スマホ・組込み → 1B、Mac mini エッジ → 2B/4B、RTX 4090 個人 → 8B、A100 業務 → 26B/40B、H100 研究 → 76B、最高性能 → Pro (商用 API)。サイズ別の MMMU は 1B = 38.5%・8B = 51.2%・76B = 67.3%、性能 vs リソースのトレードオフで選択。

Q3: Molmo / NVLM とどちらを選ぶ? A: 純粋性能 → InternVL 2 (MMMU 67.3% で最強)、Pointing UI / Apache 2.0 → Molmo、NVIDIA エコシステム / TensorRT-LLM 最適化 → NVLM。性能では InternVL 2 が OSS 中で最高、地政学・ライセンス・エコシステムの選好で判断。

まとめ

  • Shanghai AI Lab 2024年7月発表・OSS Multimodal LLM
  • 1B-108B 9 派生モデル・MIT ライセンス
  • MMMU 67.3% で GPT-4V 凌駕・OSS 最強
  • 動画入力対応・Vision Encoder InternViT-6B
  • 中国系 OSS Multimodal の代表的最強モデル
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/5/24