AI・機械学習
上級

InternVL2(インターンブイエルツー)

Shanghai AI Labが開発したオープンソースVLMシリーズ。1B〜78BまでApache 2.0で提供し商用VLMに匹敵する性能を達成。

0 回閲覧
0 いいね
2026/5/25 更新
関連タグ
オープンソースVLM
マルチモーダルAI
ビジョン言語モデル
Shanghai AI Lab
InternLM

概要

InternVL2は、中国のShanghai AI Lab(上海人工智能実験室)が2024年6月に公開したオープンソースのビジョン言語モデルシリーズである。2025年に改良版InternVL2.5がリリースされ、パラメータ数は1B・2B・4B・8B・26B・38B・78Bと幅広いバリエーションを提供している。

最大サイズのInternVL2.5-78BはMMBench(86.8)・MathVista(72.3)・DocVQA(95.4)等の主要ベンチマークでGPT-4o Visionに匹敵する性能を示し、Apache 2.0ライセンスで完全商用利用可能な点が最大の強みである。

アーキテクチャの特徴

InternVL2の設計思想は「InternViT-6B」という大型視覚エンコーダを中核に置く点にある:

  • InternViT-6B: 6Bパラメータの大型ViTエンコーダ。448×448から4096×4096まで動的解像度に対応
  • Pixel Shuffle接続層: 視覚トークンを1/4に圧縮してLLMへの入力効率を向上(計算コスト削減)
  • InternLM2.5ベースLLM: 7B・20B・34B等のInternLMをデコーダとして使用
  • 動的タイル分割: 高解像度画像を448×448のタイルに分割してVRAM効率を維持しながら解像度を向上

モデルサイズ別性能比較

モデルパラメータVRAM必要量MMBenchDocVQAMathVista主な用途
InternVL2-1B1B2GB65.574.337.7モバイル・エッジ推論
InternVL2-8B8B16GB81.791.658.3ローカル自作PC
InternVL2-26B26B52GB83.492.959.4ワークステーション
InternVL2-76B76B160GB86.394.365.5データセンター
InternVL2.5-78B78B160GB85.795.472.3データセンター

ローカル実行環境(自作PC向け)

InternVL2-8Bは現時点でコストパフォーマンスの高いローカルVLMとして人気が高い:

  • RTX 4070(VRAM 12GB): InternVL2-8B(Q4量子化・GGUF形式)が動作。処理速度12〜18 tok/s
  • RTX 4090(VRAM 24GB): InternVL2-8B(FP16フル精度)またはInternVL2-26B(Q4量子化)が動作
  • 2×RTX 4090(VRAM 48GB): InternVL2-26B(FP16)またはInternVL2-76B(Q2量子化)

Ollama実行例(ollama pull internvl2:8b)、またはllama.cppのllava-cliで動作確認済み。

ベンチマーク詳細(InternVL2.5-78B vs GPT-4o)

ベンチマークInternVL2.5-78BGPT-4o差異
MMBench-EN85.783.4+2.3
MathVista72.363.8+8.5
DocVQA95.492.8+2.6
OCRBench854736+118
ChartQA89.485.7+3.7
AI2D94.194.2-0.1

2025年11月リリースのInternVL2.5-78BはMathVistaで+8.5ポイントとGPT-4oを大幅に上回り、数学的推論能力の高さが際立つ。

他のオープンソースVLMとの比較

比較軸InternVL2.5-78BQwen2-VL-72BMolmo-72B
ライセンスApache 2.0Qwen LicenseApache 2.0
動画対応あり(64フレームまで)あり(128フレームまで)なし
OCR精度OCRBench 854OCRBench 845中程度
数学推論MathVista 72.3MathVista 74.5MathVista 58.4
コンテキスト32K tokens32K tokens4K tokens

よくある質問(FAQ)

Q1: InternVL2はHugging Faceからダウンロードできますか? A: はい。OpenGVLabがHugging Faceにすべてのサイズを公開しています。OpenGVLab/InternVL2_5-8B等のリポジトリからダウンロード可能です(無料・登録不要)。

Q2: InternVL2-8BとLLaVA-1.6-13Bはどちらが高性能ですか? A: InternVL2-8Bの方が総合的に高性能です。特にOCR(OCRBench: 794 vs 664)・数学(MathVista: 58.3 vs 37.3)で顕著な差があります。

Q3: 日本語の画像テキスト認識に使えますか? A: InternVL2は多言語OCRに対応しており、日本語のスキャン文書・看板・手書き文字の認識精度が高いです。日本語テキストが含まれる画像の処理に実績があります。

まとめ

  • InternVL2はShanghai AI Labが開発したApache 2.0完全OSSのVLMシリーズ(1B〜78B)
  • InternViT-6Bという大型視覚エンコーダが高OCR・高数学推論精度の鍵
  • InternVL2.5-78BはMMBench・MathVista等でGPT-4o Visionを上回るベンチマーク結果
  • 8BサイズならRTX 4070(VRAM 12GB)でローカル実行可能
  • Ollama・llama.cpp・vLLMで動作確認済み
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/5/25