InternVL2(インターンブイエルツー)
Shanghai AI Labが開発したオープンソースVLMシリーズ。1B〜78BまでApache 2.0で提供し商用VLMに匹敵する性能を達成。
概要
InternVL2は、中国のShanghai AI Lab(上海人工智能実験室)が2024年6月に公開したオープンソースのビジョン言語モデルシリーズである。2025年に改良版InternVL2.5がリリースされ、パラメータ数は1B・2B・4B・8B・26B・38B・78Bと幅広いバリエーションを提供している。
最大サイズのInternVL2.5-78BはMMBench(86.8)・MathVista(72.3)・DocVQA(95.4)等の主要ベンチマークでGPT-4o Visionに匹敵する性能を示し、Apache 2.0ライセンスで完全商用利用可能な点が最大の強みである。
アーキテクチャの特徴
InternVL2の設計思想は「InternViT-6B」という大型視覚エンコーダを中核に置く点にある:
- InternViT-6B: 6Bパラメータの大型ViTエンコーダ。448×448から4096×4096まで動的解像度に対応
- Pixel Shuffle接続層: 視覚トークンを1/4に圧縮してLLMへの入力効率を向上(計算コスト削減)
- InternLM2.5ベースLLM: 7B・20B・34B等のInternLMをデコーダとして使用
- 動的タイル分割: 高解像度画像を448×448のタイルに分割してVRAM効率を維持しながら解像度を向上
モデルサイズ別性能比較
| モデル | パラメータ | VRAM必要量 | MMBench | DocVQA | MathVista | 主な用途 |
|---|---|---|---|---|---|---|
| InternVL2-1B | 1B | 2GB | 65.5 | 74.3 | 37.7 | モバイル・エッジ推論 |
| InternVL2-8B | 8B | 16GB | 81.7 | 91.6 | 58.3 | ローカル自作PC |
| InternVL2-26B | 26B | 52GB | 83.4 | 92.9 | 59.4 | ワークステーション |
| InternVL2-76B | 76B | 160GB | 86.3 | 94.3 | 65.5 | データセンター |
| InternVL2.5-78B | 78B | 160GB | 85.7 | 95.4 | 72.3 | データセンター |
ローカル実行環境(自作PC向け)
InternVL2-8Bは現時点でコストパフォーマンスの高いローカルVLMとして人気が高い:
- RTX 4070(VRAM 12GB): InternVL2-8B(Q4量子化・GGUF形式)が動作。処理速度12〜18 tok/s
- RTX 4090(VRAM 24GB): InternVL2-8B(FP16フル精度)またはInternVL2-26B(Q4量子化)が動作
- 2×RTX 4090(VRAM 48GB): InternVL2-26B(FP16)またはInternVL2-76B(Q2量子化)
Ollama実行例(ollama pull internvl2:8b)、またはllama.cppのllava-cliで動作確認済み。
ベンチマーク詳細(InternVL2.5-78B vs GPT-4o)
| ベンチマーク | InternVL2.5-78B | GPT-4o | 差異 |
|---|---|---|---|
| MMBench-EN | 85.7 | 83.4 | +2.3 |
| MathVista | 72.3 | 63.8 | +8.5 |
| DocVQA | 95.4 | 92.8 | +2.6 |
| OCRBench | 854 | 736 | +118 |
| ChartQA | 89.4 | 85.7 | +3.7 |
| AI2D | 94.1 | 94.2 | -0.1 |
2025年11月リリースのInternVL2.5-78BはMathVistaで+8.5ポイントとGPT-4oを大幅に上回り、数学的推論能力の高さが際立つ。
他のオープンソースVLMとの比較
| 比較軸 | InternVL2.5-78B | Qwen2-VL-72B | Molmo-72B |
|---|---|---|---|
| ライセンス | Apache 2.0 | Qwen License | Apache 2.0 |
| 動画対応 | あり(64フレームまで) | あり(128フレームまで) | なし |
| OCR精度 | OCRBench 854 | OCRBench 845 | 中程度 |
| 数学推論 | MathVista 72.3 | MathVista 74.5 | MathVista 58.4 |
| コンテキスト | 32K tokens | 32K tokens | 4K tokens |
よくある質問(FAQ)
Q1: InternVL2はHugging Faceからダウンロードできますか? A: はい。OpenGVLabがHugging Faceにすべてのサイズを公開しています。OpenGVLab/InternVL2_5-8B等のリポジトリからダウンロード可能です(無料・登録不要)。
Q2: InternVL2-8BとLLaVA-1.6-13Bはどちらが高性能ですか? A: InternVL2-8Bの方が総合的に高性能です。特にOCR(OCRBench: 794 vs 664)・数学(MathVista: 58.3 vs 37.3)で顕著な差があります。
Q3: 日本語の画像テキスト認識に使えますか? A: InternVL2は多言語OCRに対応しており、日本語のスキャン文書・看板・手書き文字の認識精度が高いです。日本語テキストが含まれる画像の処理に実績があります。
まとめ
- InternVL2はShanghai AI Labが開発したApache 2.0完全OSSのVLMシリーズ(1B〜78B)
- InternViT-6Bという大型視覚エンコーダが高OCR・高数学推論精度の鍵
- InternVL2.5-78BはMMBench・MathVista等でGPT-4o Visionを上回るベンチマーク結果
- 8BサイズならRTX 4070(VRAM 12GB)でローカル実行可能
- Ollama・llama.cpp・vLLMで動作確認済み