AI・機械学習
上級
InternVideo2(インターンビデオツー)
Shanghai AI Labが2024年発表の動画基盤モデル。マルチタスク学習フレームワークで動画認識・理解・検索を統合。InternVL視覚エンコーダとInternLMを組み合わせた6Bパラメータモデル。
0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
動画理解
基盤モデル
Shanghai AI Lab
マスクビデオモデリング
マルチタスク
InternVideo2 とは
InternVideo2 は上海人工智能実験室(Shanghai AI Lab)が 2024 年 1 月に発表した動画基盤モデル(Video Foundation Model)。動画認識・動画-テキスト検索・動画質問応答を統合する汎用フレームワークとして設計されている。
3段階学習フレームワーク
Stage 1: マスクビデオモデリング(MVM)
動画フレームをランダムマスキングして復元学習。時空間的なマスク予測により、動作・オブジェクト・シーン変化の暗黙的理解を獲得。
Stage 2: ビデオ-テキスト対照学習
CLIP を動画ドメインに拡張。HowTo100M + WebVid + CC12M 等のデータで動画とテキストの意味的整合を学習。zero-shot 動画-テキスト検索能力を習得。
Stage 3: ユニファイドトレーニング
分類・検索・QA を同時に最適化するマルチタスク学習:
- 映像分類: Kinetics/SomethingSomething/UCF
- 動画検索: MSR-VTT/DiDeMo/ActivityNet Captions
- 動画 QA: NExT-QA/EgoSchema/VideoChatGPT
モデル構成
- 視覚エンコーダ: InternVL ViT-6B(InternImage ベース)
- 言語モデル: InternLM-7B
- 時間モデリング: Temporal Attention + Pooling
- 総パラメータ: ~6B
ベンチマーク
- Kinetics-400: 92.1%(前 SOTA 91.6% 超え)
- Something-Something V2: 77.5%
- UCF-101: 99.2%
- MSR-VTT R@1: 62.2%
- DiDeMo R@1: 57.9%
利用方法
import torch
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained(
"OpenGVLab/InternVideo2-Chat-8B",
torch_dtype=torch.bfloat16,
trust_remote_code=True
).cuda()
tokenizer = AutoTokenizer.from_pretrained(
"OpenGVLab/InternVideo2-Chat-8B",
trust_remote_code=True
)
video_path = "video.mp4"
question = "この動画で何が起きていますか?"
response = model.chat(video_path=video_path, question=question, tokenizer=tokenizer)
print(response)
活用例
- コンテンツ自動タグ付け: 大量動画の意味的分類
- 動画検索エンジン: テキストクエリによるシーン検索
- スポーツ分析: アクション認識・統計
- 教育コンテンツ: 動画講義の理解度チェック Q&A