AI・機械学習
上級

InternVideo2(インターンビデオツー)

Shanghai AI Labが2024年発表の動画基盤モデル。マルチタスク学習フレームワークで動画認識・理解・検索を統合。InternVL視覚エンコーダとInternLMを組み合わせた6Bパラメータモデル。

0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
動画理解
基盤モデル
Shanghai AI Lab
マスクビデオモデリング
マルチタスク

InternVideo2 とは

InternVideo2 は上海人工智能実験室(Shanghai AI Lab)が 2024 年 1 月に発表した動画基盤モデル(Video Foundation Model)。動画認識・動画-テキスト検索・動画質問応答を統合する汎用フレームワークとして設計されている。

3段階学習フレームワーク

Stage 1: マスクビデオモデリング(MVM)

動画フレームをランダムマスキングして復元学習。時空間的なマスク予測により、動作・オブジェクト・シーン変化の暗黙的理解を獲得。

Stage 2: ビデオ-テキスト対照学習

CLIP を動画ドメインに拡張。HowTo100M + WebVid + CC12M 等のデータで動画とテキストの意味的整合を学習。zero-shot 動画-テキスト検索能力を習得。

Stage 3: ユニファイドトレーニング

分類・検索・QA を同時に最適化するマルチタスク学習:

  • 映像分類: Kinetics/SomethingSomething/UCF
  • 動画検索: MSR-VTT/DiDeMo/ActivityNet Captions
  • 動画 QA: NExT-QA/EgoSchema/VideoChatGPT

モデル構成

  • 視覚エンコーダ: InternVL ViT-6B(InternImage ベース)
  • 言語モデル: InternLM-7B
  • 時間モデリング: Temporal Attention + Pooling
  • 総パラメータ: ~6B

ベンチマーク

  • Kinetics-400: 92.1%(前 SOTA 91.6% 超え)
  • Something-Something V2: 77.5%
  • UCF-101: 99.2%
  • MSR-VTT R@1: 62.2%
  • DiDeMo R@1: 57.9%

利用方法

import torch
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained(
    "OpenGVLab/InternVideo2-Chat-8B",
    torch_dtype=torch.bfloat16,
    trust_remote_code=True
).cuda()
tokenizer = AutoTokenizer.from_pretrained(
    "OpenGVLab/InternVideo2-Chat-8B",
    trust_remote_code=True
)

video_path = "video.mp4"
question = "この動画で何が起きていますか?"
response = model.chat(video_path=video_path, question=question, tokenizer=tokenizer)
print(response)

活用例

  • コンテンツ自動タグ付け: 大量動画の意味的分類
  • 動画検索エンジン: テキストクエリによるシーン検索
  • スポーツ分析: アクション認識・統計
  • 教育コンテンツ: 動画講義の理解度チェック Q&A
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/8