InternVL 2 (Shanghai AI Lab 2024)(インターンブイエル2・2024)
Shanghai AI Lab 2024年7月発表 OSS マルチモーダル LLM。1B-108B 派生・GPT-4V 凌駕性能・MIT・中国系最強
概要
InternVL 2 は 2024年7月4日に Shanghai AI Lab(上海人工智能実験室、2020年設立)+ 上海交通大学 + 香港大学 + 清華大学等の研究チームが発表した OSS マルチモーダル LLM ファミリー(HuggingFace: OpenGVLab/InternVL2 シリーズ)。1B-108B 派生(InternVL2-1B/2B/4B/8B/26B/40B/76B/Llama3-76B/Pro 等 9 モデル)・GPT-4V 凌駕性能(MMMU 67.3% / VQAv2 96.4% / ChartQA 87.5%)・MIT ライセンス・中国系 OSS Multimodal の最強モデル。
Shanghai AI Lab は 2020 年に中国政府支援で設立された AI 研究機関で、OpenGVLab(オープンビジョン研究グループ)配下で InternVL シリーズ(InternVL 1.0 2023-12 → 1.5 2024-04 → 2.0 2024-07)を継続開発。InternVL 2 は GPT-4V (2023-09) 公開以降、中国系 OSS Multimodal モデルの最高峰として 2024 年で最も話題になったモデルの一つ。
革新は (1) 9 派生モデル:1B (Mac mini 動作)・2B/4B (エッジ)・8B (RTX 4090)・26B/40B (高性能 GPU)・76B (フル版)・Llama3-76B (Meta Llama 3 ベース)・Pro (中国 API のみ) と幅広いサイズ展開 (2) GPT-4V 凌駕:MMMU・VQA・OCR の主要ベンチマークで商用 GPT-4V を上回り、OSS で初の偉業 (3) Vision Encoder 強化: InternViT-6B(Shanghai AI Lab 独自)で従来 CLIP-ViT より高解像度対応 (4) 動画入力対応:InternVL2 シリーズで動画フレーム解析可。
ライセンス MIT、HuggingFace で無料公開、商用利用可。中国 SenseTime・Alibaba 等で商用採用、グローバル研究コミュニティでも広く利用。
主な特徴・仕組み
- 派生モデル: 1B/2B/4B/8B/26B/40B/76B/Llama3-76B/Pro 9 種
- ベース LLM: Qwen / Llama / InternLM の組合せ(モデルで異なる)
- Vision Encoder: InternViT-6B(Shanghai AI Lab 独自)
- MMMU: 67.3%(GPT-4V 56.8% を凌駕)
- VQAv2: 96.4%
- ChartQA: 87.5%
- DocVQA: 95.1%
- OCR Bench: 794
- 動画入力: 対応(複数フレーム解析)
- コンテキスト: 8K-32K(モデルで異なる)
- ライセンス: MIT
- VRAM: 76B = 152GB FP16・38GB INT4
- OS バージョン: InternVL2 (2024-07)・InternVL2.5 (2024-12 改良)
スペック比較表
| 項目 | InternVL 2-76B (2024) | GPT-4o | Gemini 1.5 Pro | Molmo 72B | NVLM 1.0 72B |
|---|---|---|---|---|---|
| パラメータ | 76B | unknown | unknown | 72B | 72B |
| MMMU | 67.3% | 69.1% | 62.2% | 54.1% | 59.7% |
| VQAv2 | 96.4% | unknown | unknown | 96.3% | unknown |
| ChartQA | 87.5% | unknown | unknown | unknown | unknown |
| ライセンス | MIT | proprietary | proprietary | Apache 2.0 | MIT |
| 動画入力 | あり | なし | あり | なし | なし |
| 派生サイズ | 1B-108B | 1 種 | 1 種 | 1B-72B | 72B のみ |
具体例・対応製品
- OpenGVLab/InternVL2-76B (HuggingFace 2024-07): フル版
- OpenGVLab/InternVL2-Llama3-76B: Meta Llama 3 ベース版
- OpenGVLab/InternVL2-8B: RTX 4090 24GB 動作可
- OpenGVLab/InternVL2-1B: Mac mini M2 動作可
- InternVL2 Pro (中国 API): 商用 API、$0.5/1M トークン
選び方・注意点
- OSS Multimodal 最強級: MMMU 67.3% で GPT-4V 凌駕・Gemini 1.5 Pro (62.2%) も上回り、Molmo (54.1%) を圧倒
- 9 派生モデルサイズ: 用途別最適選択可、1B → スマホ・8B → RTX 4090・76B → 高性能 GPU
- MIT ライセンス: 商用利用完全自由、Apache 2.0 とほぼ同等の緩いライセンス
- 動画対応: 複数フレーム解析可、Gemini 1.5 Pro と並ぶ OSS で唯一の動画対応
- 中国系の地政学リスク: 米国制裁・データ規制対応必要、自社 GPU 推奨
- 2024-12 InternVL 2.5 改良: 性能向上 + 動画長文対応強化、新規利用は 2.5 推奨
- Pro 版(商用 API): Shanghai AI Lab 直 API、$0.5/1M で破格コスパ
関連用語との違い
| 用語 | 違い |
|---|---|
| InternVL 2 (Shanghai AI Lab 2024) | OSS 1B-108B・MIT・GPT-4V 凌駕 |
| GPT-4o (OpenAI 2024) | 商用・音声統合 |
| Gemini 1.5 Pro (2024) | 1M-2M context・動画 |
| Molmo (Allen AI 2024) | OSS 72B・Apache 2.0 |
| NVLM (NVIDIA 2024) | OSS NVIDIA 戦略 72B |
よくある質問(FAQ)
Q1: GPT-4V 凌駕の意味は? A: 2023-09 公開 GPT-4V(GPT-4 with Vision)は当時の Multimodal LLM 絶対王者、OSS で MMMU 56.8% を超えるのは不可能と思われていた。InternVL 2-76B が 2024-07 に MMMU 67.3% で 10 ポイント以上の差を付けて凌駕、「OSS が商用最強モデルを超える」中国系 AI 研究の象徴的成果。
Q2: 9 派生モデルの使い分けは? A: スマホ・組込み → 1B、Mac mini エッジ → 2B/4B、RTX 4090 個人 → 8B、A100 業務 → 26B/40B、H100 研究 → 76B、最高性能 → Pro (商用 API)。サイズ別の MMMU は 1B = 38.5%・8B = 51.2%・76B = 67.3%、性能 vs リソースのトレードオフで選択。
Q3: Molmo / NVLM とどちらを選ぶ? A: 純粋性能 → InternVL 2 (MMMU 67.3% で最強)、Pointing UI / Apache 2.0 → Molmo、NVIDIA エコシステム / TensorRT-LLM 最適化 → NVLM。性能では InternVL 2 が OSS 中で最高、地政学・ライセンス・エコシステムの選好で判断。
まとめ
- Shanghai AI Lab 2024年7月発表・OSS Multimodal LLM
- 1B-108B 9 派生モデル・MIT ライセンス
- MMMU 67.3% で GPT-4V 凌駕・OSS 最強
- 動画入力対応・Vision Encoder InternViT-6B
- 中国系 OSS Multimodal の代表的最強モデル