InternVL 2.5(マルチモーダルLLM)(インターンブイエル ツーテンファイブ マルチモーダル エルエルエム)
上海AI研究所(Shanghai AI Lab)が開発したオープンソースマルチモーダルLLM。1Bから78Bまでの豊富なサイズ展開と、画像・動画の高精度理解を強みとし、2024年末のベンチマークでGPT-4o・Claude 3.5 Sonnetに匹敵する性能を示したオープンソース代表モデル。
InternVL 2.5(マルチモーダルLLM)とは
InternVL 2.5は上海AI研究所(Shanghai Artificial Intelligence Laboratory)が2024年12月に発表したマルチモーダルLLMシリーズ。前作InternVL 2.0から大幅に性能向上し、オープンソースモデルとして初めてGPT-4o・Claude 3.5 Sonnet水準のマルチモーダル性能を達成したとして注目を集めた。
モデルサイズ展開(1B〜78B)
| モデル | パラメータ | VRAM要件 | 用途 |
|---|---|---|---|
| InternVL2.5-1B | 10億 | ~2GB | エッジデバイス・モバイル |
| InternVL2.5-2B | 20億 | ~4GB | 軽量ローカル推論 |
| InternVL2.5-4B | 40億 | ~8GB | コスパ最高の汎用モデル |
| InternVL2.5-8B | 80億 | ~16GB | 高精度ローカル推論 |
| InternVL2.5-26B | 260億 | ~52GB | プロフェッショナル用途 |
| InternVL2.5-38B | 380億 | ~80GB | クラウドAPI向け |
| InternVL2.5-78B | 780億 | ~160GB | 最高精度(GPT-4o比較) |
アーキテクチャ: InternViT + InternLM
InternVLの核心は「ダイナミック高解像度分割」:
- 入力画像を動的に1〜12タイルに分割(最大4K解像度対応)
- 各タイルをInternViT-300M(ビジョンエンコーダ)で処理
- タイル特徴量をMLP Projectorでテキストトークン空間に変換
- InternLM言語モデルで統合推論
この設計により、小さな文字や細部が多い文書・図面の高精度認識を実現。
主要ベンチマーク性能(2024年末時点)
| ベンチマーク | InternVL2.5-78B | GPT-4o | Claude 3.5 |
|---|---|---|---|
| DocVQA(文書理解) | 96.2% | 92.8% | 95.2% |
| ChartQA(グラフ理解) | 88.3% | 85.7% | 90.8% |
| MMBench-EN(総合) | 82.4% | 83.4% | 79.7% |
| OCRBench | 85.3% | 79.4% | 78.1% |
文書・グラフ・OCR系タスクでは最高水準のオープンソースモデル。
動画理解
InternVL 2.5は動画の複数フレームを時系列で入力し、シーン理解・行動認識・テロップ抽出に対応。最大1024フレームをコンテキスト内に格納できる(モデルサイズにより異なる)。
実用例:
- 工場ライン監視カメラの異常検知
- スポーツ映像の戦術分析
- 教育動画からの重要ポイント抽出
中英二言語の強み
InternVLは中国語・英語の二言語に対して特に高い精度を持つ。日本語も対応するが、中英比で精度は若干下がる。中国語OCR・中文ドキュメント処理では業界最高水準を誇り、日中英の三言語混在文書にも対応。
ローカル実行(HuggingFace)
import torch
from transformers import AutoTokenizer, AutoModel
from PIL import Image
model_name = "OpenGVLab/InternVL2_5-8B"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(
model_name,
torch_dtype=torch.bfloat16,
trust_remote_code=True
).eval().cuda()
商用利用
InternVL 2.5はMIT LicenseまたはApache 2.0 Licenseで公開されており、制限なしの商用利用・改変・再配布が可能。企業が社内システムに統合する際の法的リスクが低い点で、Llama系(使用条件あり)と差別化される。
よくある質問(FAQ)
Q1: InternVL 2.5とLlama 3.2 Visionどちらが良い? A: OCR・文書解析・グラフ理解ならInternVL 2.5が優位。汎用チャット・英語タスクはLlama 3.2が使いやすい。InternVL 2.5のライセンス(MIT/Apache)はLlamaより制限が少ない。
Q2: 最小サイズの1Bモデルは実用的か? A: 単純な画像キャプション生成・物体認識なら実用的。複雑な文書解析には4B以上を推奨。エッジデバイス(Jetson Orin等)での動作実績あり。
Q3: 日本語の精度は? A: 日本語テキストを含む画像は認識可能だが、中英比で精度が下がる場合あり。日本語特化ファインチューニングを施したサードパーティ版も存在する。
まとめ
- InternVL 2.5 = 2024年末時点でGPT-4o/Claude 3.5水準に達したオープンソース最高峰マルチモーダルLLM
- 1B〜78Bのサイズ展開でエッジから大規模推論まで対応、MIT/Apache 2.0ライセンスで商用利用自由
- 文書・グラフ・OCR系ベンチマークでオープンソース最高水準