AI・機械学習
上級

InternVL 2.5(マルチモーダルLLM)(インターンブイエル ツーテンファイブ マルチモーダル エルエルエム)

上海AI研究所(Shanghai AI Lab)が開発したオープンソースマルチモーダルLLM。1Bから78Bまでの豊富なサイズ展開と、画像・動画の高精度理解を強みとし、2024年末のベンチマークでGPT-4o・Claude 3.5 Sonnetに匹敵する性能を示したオープンソース代表モデル。

0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
マルチモーダルLLM
InternVL
Shanghai AI Lab
オープンソース
OCR特化
動画理解

InternVL 2.5(マルチモーダルLLM)とは

InternVL 2.5は上海AI研究所(Shanghai Artificial Intelligence Laboratory)が2024年12月に発表したマルチモーダルLLMシリーズ。前作InternVL 2.0から大幅に性能向上し、オープンソースモデルとして初めてGPT-4o・Claude 3.5 Sonnet水準のマルチモーダル性能を達成したとして注目を集めた。

モデルサイズ展開(1B〜78B)

モデルパラメータVRAM要件用途
InternVL2.5-1B10億~2GBエッジデバイス・モバイル
InternVL2.5-2B20億~4GB軽量ローカル推論
InternVL2.5-4B40億~8GBコスパ最高の汎用モデル
InternVL2.5-8B80億~16GB高精度ローカル推論
InternVL2.5-26B260億~52GBプロフェッショナル用途
InternVL2.5-38B380億~80GBクラウドAPI向け
InternVL2.5-78B780億~160GB最高精度(GPT-4o比較)

アーキテクチャ: InternViT + InternLM

InternVLの核心は「ダイナミック高解像度分割」:

  1. 入力画像を動的に1〜12タイルに分割(最大4K解像度対応)
  2. 各タイルをInternViT-300M(ビジョンエンコーダ)で処理
  3. タイル特徴量をMLP Projectorでテキストトークン空間に変換
  4. InternLM言語モデルで統合推論

この設計により、小さな文字や細部が多い文書・図面の高精度認識を実現。

主要ベンチマーク性能(2024年末時点)

ベンチマークInternVL2.5-78BGPT-4oClaude 3.5
DocVQA(文書理解)96.2%92.8%95.2%
ChartQA(グラフ理解)88.3%85.7%90.8%
MMBench-EN(総合)82.4%83.4%79.7%
OCRBench85.3%79.4%78.1%

文書・グラフ・OCR系タスクでは最高水準のオープンソースモデル。

動画理解

InternVL 2.5は動画の複数フレームを時系列で入力し、シーン理解・行動認識・テロップ抽出に対応。最大1024フレームをコンテキスト内に格納できる(モデルサイズにより異なる)。

実用例:

  • 工場ライン監視カメラの異常検知
  • スポーツ映像の戦術分析
  • 教育動画からの重要ポイント抽出

中英二言語の強み

InternVLは中国語・英語の二言語に対して特に高い精度を持つ。日本語も対応するが、中英比で精度は若干下がる。中国語OCR・中文ドキュメント処理では業界最高水準を誇り、日中英の三言語混在文書にも対応。

ローカル実行(HuggingFace)

import torch
from transformers import AutoTokenizer, AutoModel
from PIL import Image

model_name = "OpenGVLab/InternVL2_5-8B"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    trust_remote_code=True
).eval().cuda()

商用利用

InternVL 2.5はMIT LicenseまたはApache 2.0 Licenseで公開されており、制限なしの商用利用・改変・再配布が可能。企業が社内システムに統合する際の法的リスクが低い点で、Llama系(使用条件あり)と差別化される。

よくある質問(FAQ)

Q1: InternVL 2.5とLlama 3.2 Visionどちらが良い? A: OCR・文書解析・グラフ理解ならInternVL 2.5が優位。汎用チャット・英語タスクはLlama 3.2が使いやすい。InternVL 2.5のライセンス(MIT/Apache)はLlamaより制限が少ない。

Q2: 最小サイズの1Bモデルは実用的か? A: 単純な画像キャプション生成・物体認識なら実用的。複雑な文書解析には4B以上を推奨。エッジデバイス(Jetson Orin等)での動作実績あり。

Q3: 日本語の精度は? A: 日本語テキストを含む画像は認識可能だが、中英比で精度が下がる場合あり。日本語特化ファインチューニングを施したサードパーティ版も存在する。

まとめ

  • InternVL 2.5 = 2024年末時点でGPT-4o/Claude 3.5水準に達したオープンソース最高峰マルチモーダルLLM
  • 1B〜78Bのサイズ展開でエッジから大規模推論まで対応、MIT/Apache 2.0ライセンスで商用利用自由
  • 文書・グラフ・OCR系ベンチマークでオープンソース最高水準
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/7