AI・機械学習
上級
InternVL3(インターンブイエルスリー)
Shanghai AI Laboratory開発のオープンソースビジョン言語モデルシリーズ。InternViT視覚エンコーダーとInternLM2テキストモデルを組み合わせ、2B〜78Bまでの複数サイズを提供する。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
ビジョン言語モデル
オープンソース
マルチスケール
チャート理解
InternVL3 — 商用グレードのオープンソースVLM
概要
InternVLは2023年に登場し、InternVL2・InternVL2.5・InternVL3と急速に改良されたVLMシリーズ。Shanghai AI Laboratoryが主導し、InternLM(同機関のLLM)と組み合わせて開発されている。2025年3月に公開されたInternVL3は、オープンVLMとして最高水準のベンチマーク性能を示した。
モデルラインアップ(InternVL3)
| サイズ | パラメータ | VRAM要件 | 主要用途 |
|---|---|---|---|
| InternVL3-2B | 2B | ~6GB | エッジデバイス、組込 |
| InternVL3-4B | 4B | ~10GB | 軽量ローカル推論 |
| InternVL3-8B | 8B | ~20GB | バランス型 |
| InternVL3-14B | 14B | ~35GB | 高品質ローカル |
| InternVL3-38B | 38B | ~80GB | 研究・API |
| InternVL3-78B | 78B | ~160GB | GPT-4o競合 |
アーキテクチャの特徴
InternViT-6B 視覚エンコーダー:
- 6Bパラメータの大規模視覚エンコーダー(他のVLMの視覚エンコーダーは通常0.3〜1B)
- 動的高解像度処理(448×448の複数タイルに分割)
- 最大4096×4096のネイティブ解像度サポート
Pixel Shuffle 圧縮: 視覚トークン数を1/4に圧縮しながら情報損失を最小化。効率的な長文脈処理を実現。
ベンチマーク(InternVL3-78B、2025年)
| ベンチマーク | スコア | 比較 |
|---|---|---|
| MMMU | 83.5 | GPT-4o: 82.5 |
| MathVista | 77.4 | Claude 3.5 Sonnet: 75.0 |
| DocVQA | 95.9 | GPT-4V: 88.4 |
| AI2D | 89.5 | Gemini 1.5 Pro: 86.5 |
| OCRBench | 928/1000 | 最高クラス |
強み: チャート・ドキュメント理解
InternVL3の特筆すべき強みはドキュメント・チャート解析精度。
- 学術論文PDF: 数式・図・表を含む複雑なPDFの構造理解
- ビジネス文書: 請求書・契約書・仕様書のOCRとQA
- データビジュアライゼーション: 折れ線グラフ・棒グラフ・散布図の数値読取
- 医療画像: X線・病理スライドの初期解析(研究用途)
ローカル実行
# HuggingFace transformers で実行
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained("OpenGVLab/InternVL3-8B",
torch_dtype="auto", device_map="auto")
Ollamaは2025年時点でInternVL系の直接サポートが限定的だが、llama.cppのGGUF変換で実行可能。
商用ライセンス
InternVL3はMIT Licenseで公開。商用利用・改変・再配布が自由。企業が自社APIサービスに組み込む際にも利用可能な点が競合オープンモデルより有利。