AI・機械学習
上級

InternVL3(インターンブイエルスリー)

Shanghai AI Laboratory開発のオープンソースビジョン言語モデルシリーズ。InternViT視覚エンコーダーとInternLM2テキストモデルを組み合わせ、2B〜78Bまでの複数サイズを提供する。

0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
ビジョン言語モデル
オープンソース
マルチスケール
チャート理解

InternVL3 — 商用グレードのオープンソースVLM

概要

InternVLは2023年に登場し、InternVL2・InternVL2.5・InternVL3と急速に改良されたVLMシリーズ。Shanghai AI Laboratoryが主導し、InternLM(同機関のLLM)と組み合わせて開発されている。2025年3月に公開されたInternVL3は、オープンVLMとして最高水準のベンチマーク性能を示した。

モデルラインアップ(InternVL3)

サイズパラメータVRAM要件主要用途
InternVL3-2B2B~6GBエッジデバイス、組込
InternVL3-4B4B~10GB軽量ローカル推論
InternVL3-8B8B~20GBバランス型
InternVL3-14B14B~35GB高品質ローカル
InternVL3-38B38B~80GB研究・API
InternVL3-78B78B~160GBGPT-4o競合

アーキテクチャの特徴

InternViT-6B 視覚エンコーダー:

  • 6Bパラメータの大規模視覚エンコーダー(他のVLMの視覚エンコーダーは通常0.3〜1B)
  • 動的高解像度処理(448×448の複数タイルに分割)
  • 最大4096×4096のネイティブ解像度サポート

Pixel Shuffle 圧縮: 視覚トークン数を1/4に圧縮しながら情報損失を最小化。効率的な長文脈処理を実現。

ベンチマーク(InternVL3-78B、2025年)

ベンチマークスコア比較
MMMU83.5GPT-4o: 82.5
MathVista77.4Claude 3.5 Sonnet: 75.0
DocVQA95.9GPT-4V: 88.4
AI2D89.5Gemini 1.5 Pro: 86.5
OCRBench928/1000最高クラス

強み: チャート・ドキュメント理解

InternVL3の特筆すべき強みはドキュメント・チャート解析精度。

  • 学術論文PDF: 数式・図・表を含む複雑なPDFの構造理解
  • ビジネス文書: 請求書・契約書・仕様書のOCRとQA
  • データビジュアライゼーション: 折れ線グラフ・棒グラフ・散布図の数値読取
  • 医療画像: X線・病理スライドの初期解析(研究用途)

ローカル実行

# HuggingFace transformers で実行
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained("OpenGVLab/InternVL3-8B",
    torch_dtype="auto", device_map="auto")

Ollamaは2025年時点でInternVL系の直接サポートが限定的だが、llama.cppのGGUF変換で実行可能。

商用ライセンス

InternVL3はMIT Licenseで公開。商用利用・改変・再配布が自由。企業が自社APIサービスに組み込む際にも利用可能な点が競合オープンモデルより有利。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/6