AI・機械学習
上級

InternImage(インターンイメージ)

Shanghai AI Labが開発したDCNv3(変形可能畳み込みv3)を核とする大規模ビジョン基盤モデル。InternImage-H(10.89B)でCOCO AP 65.5を達成し、ViTベースを超えた。

0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
畳み込みニューラルネットワーク
物体検出
セグメンテーション
Shanghai AI Lab
基盤モデル

InternImage とは

InternImage は、上海人工智能実験室(Shanghai AI Lab)が2022-2023年にかけて発表した CNN ベースの大規模ビジョン基盤モデル。Transformer(ViT)全盛期に、変形可能畳み込みv3(DCNv3)という革新的オペレータで CNN の可能性を再証明し、COCO AP 65.5(当時 SOTA)を達成した。

DCNv3: 変形可能畳み込みの進化

DCN系の系譜

バージョン特徴発表年
DCN v1可変サンプリング点(固定重み)2017
DCN v2注意重み追加(空間次元のみ)2019
DCNv3グループ共有重み + ソフトマックス正規化2022

DCNv3の技術的特徴

1. 動的スパーシャルアグリゲーション

各サンプリング点の位置を入力に応じて動的に決定。固定カーネル位置の標準畳み込みと異なり、変形可能な受容野を実現。

# DCNv3の概念
for each output position p0:
    # オフセット予測
    offsets = offset_net(input)  # (K個のオフセット)
    # 正規化重み
    weights = softmax(weight_net(input))  # ΣW = 1
    # 変形可能サンプリング
    output[p0] = Σ(weights[k] * input[p0 + offsets[k]])

2. グループ分割重み共有

マルチヘッドアテンションに類似したグループ分割で、チャネル方向の多様な表現を学習可能。

3. 深さ方向分離

空間操作(DCNv3)とチャネルミキシング(pointwise conv)を分離し、計算効率を向上。

モデルサイズとベンチマーク

モデルパラメータCOCO AP (Det)ADE20K mIoU (Seg)
InternImage-T30M54.947.9
InternImage-S50M56.150.1
InternImage-B97M56.851.9
InternImage-L223M57.754.9
InternImage-XL335M58.455.3
InternImage-H1.08B65.462.9

InternImage-H は CLIP+ViT や Swin-B/L を上回る精度を CNN アーキテクチャで達成。

Detectron2/MMDetection での使用

# MMDetection 設定例
_base_ = [
    "../_base_/models/mask_rcnn_internimage_t_fpn.py",
    "../_base_/datasets/coco_instance.py",
    "../_base_/schedules/schedule_1x.py",
    "../_base_/default_runtime.py"
]

model = dict(
    backbone=dict(
        type="InternImage",
        core_op="DCNv3",
        channels=64,
        depths=[4, 4, 18, 4],  # InternImage-T
        groups=[4, 8, 16, 32],
        mlp_ratio=4.0,
        drop_path_rate=0.2,
        norm_layer="LN",
        layer_scale=1.0,
        post_norm=True,
        with_cp=False,
        out_indices=(0, 1, 2, 3),
        init_cfg=dict(
            type="Pretrained",
            checkpoint="internimage_t_1k_224.pth"
        )
    )
)

InternVL との連携

InternImageの視覚エンコーダはInternVL(大規模視覚言語モデル)シリーズにも採用されている。InternVL 1.0/1.5/2.0では、InternImageで学習した強力な視覚表現をLLM(InternLM/Mistral)と組み合わせることで、高性能マルチモーダルLLMを実現。

ライセンスと入手

  • ライセンス: MIT License(商用利用可)
  • HuggingFace: OpenGVLab/InternImage
  • GitHub: OpenGVLab/InternImage(MMDetection/MMSegmentation統合)
  • 事前学習済みモデル: ImageNet-1K/22K学習済みチェックポイント配布

活用事例

  • 自律移動ロボット: 精密な物体検出・セグメンテーション
  • 衛星・航空画像解析: 建物・農地の高精度セグメント
  • 医療画像診断: 臓器・病変の精密検出
  • 産業品質管理: 製品外観の詳細検査
  • InternVL基盤: マルチモーダルLLMの視覚エンコーダ
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/7