AI・機械学習
上級
InternImage(インターンイメージ)
Shanghai AI Labが開発したDCNv3(変形可能畳み込みv3)を核とする大規模ビジョン基盤モデル。InternImage-H(10.89B)でCOCO AP 65.5を達成し、ViTベースを超えた。
0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
畳み込みニューラルネットワーク
物体検出
セグメンテーション
Shanghai AI Lab
基盤モデル
InternImage とは
InternImage は、上海人工智能実験室(Shanghai AI Lab)が2022-2023年にかけて発表した CNN ベースの大規模ビジョン基盤モデル。Transformer(ViT)全盛期に、変形可能畳み込みv3(DCNv3)という革新的オペレータで CNN の可能性を再証明し、COCO AP 65.5(当時 SOTA)を達成した。
DCNv3: 変形可能畳み込みの進化
DCN系の系譜
| バージョン | 特徴 | 発表年 |
|---|---|---|
| DCN v1 | 可変サンプリング点(固定重み) | 2017 |
| DCN v2 | 注意重み追加(空間次元のみ) | 2019 |
| DCNv3 | グループ共有重み + ソフトマックス正規化 | 2022 |
DCNv3の技術的特徴
1. 動的スパーシャルアグリゲーション
各サンプリング点の位置を入力に応じて動的に決定。固定カーネル位置の標準畳み込みと異なり、変形可能な受容野を実現。
# DCNv3の概念
for each output position p0:
# オフセット予測
offsets = offset_net(input) # (K個のオフセット)
# 正規化重み
weights = softmax(weight_net(input)) # ΣW = 1
# 変形可能サンプリング
output[p0] = Σ(weights[k] * input[p0 + offsets[k]])
2. グループ分割重み共有
マルチヘッドアテンションに類似したグループ分割で、チャネル方向の多様な表現を学習可能。
3. 深さ方向分離
空間操作(DCNv3)とチャネルミキシング(pointwise conv)を分離し、計算効率を向上。
モデルサイズとベンチマーク
| モデル | パラメータ | COCO AP (Det) | ADE20K mIoU (Seg) |
|---|---|---|---|
| InternImage-T | 30M | 54.9 | 47.9 |
| InternImage-S | 50M | 56.1 | 50.1 |
| InternImage-B | 97M | 56.8 | 51.9 |
| InternImage-L | 223M | 57.7 | 54.9 |
| InternImage-XL | 335M | 58.4 | 55.3 |
| InternImage-H | 1.08B | 65.4 | 62.9 |
InternImage-H は CLIP+ViT や Swin-B/L を上回る精度を CNN アーキテクチャで達成。
Detectron2/MMDetection での使用
# MMDetection 設定例
_base_ = [
"../_base_/models/mask_rcnn_internimage_t_fpn.py",
"../_base_/datasets/coco_instance.py",
"../_base_/schedules/schedule_1x.py",
"../_base_/default_runtime.py"
]
model = dict(
backbone=dict(
type="InternImage",
core_op="DCNv3",
channels=64,
depths=[4, 4, 18, 4], # InternImage-T
groups=[4, 8, 16, 32],
mlp_ratio=4.0,
drop_path_rate=0.2,
norm_layer="LN",
layer_scale=1.0,
post_norm=True,
with_cp=False,
out_indices=(0, 1, 2, 3),
init_cfg=dict(
type="Pretrained",
checkpoint="internimage_t_1k_224.pth"
)
)
)
InternVL との連携
InternImageの視覚エンコーダはInternVL(大規模視覚言語モデル)シリーズにも採用されている。InternVL 1.0/1.5/2.0では、InternImageで学習した強力な視覚表現をLLM(InternLM/Mistral)と組み合わせることで、高性能マルチモーダルLLMを実現。
ライセンスと入手
- ライセンス: MIT License(商用利用可)
- HuggingFace:
OpenGVLab/InternImage - GitHub:
OpenGVLab/InternImage(MMDetection/MMSegmentation統合) - 事前学習済みモデル: ImageNet-1K/22K学習済みチェックポイント配布
活用事例
- 自律移動ロボット: 精密な物体検出・セグメンテーション
- 衛星・航空画像解析: 建物・農地の高精度セグメント
- 医療画像診断: 臓器・病変の精密検出
- 産業品質管理: 製品外観の詳細検査
- InternVL基盤: マルチモーダルLLMの視覚エンコーダ