AI・機械学習
初級

Computer Vision(コンピュータービジョン)

Computer Visionは、人工知能・機械学習分野における重要な概念・技術です。

0 回閲覧
0 いいね
2026/4/25 更新
関連タグ
AI
機械学習
初心者向け

Computer Vision(コンピュータビジョン)

概要

Computer Vision(コンピュータビジョン、CV)は、コンピュータに画像や動画を「見る」能力を与え、視覚情報から意味のある情報を抽出・理解・判断する技術分野です。1960 年代から研究されてきましたが、2012 年の AlexNet による深層学習革命以降、急速に発展し、現代では自動運転、医療診断、顔認証、産業検査、AR/VR など社会インフラを支える基盤技術となっています。

主要なタスク

1. Image Classification(画像分類)

画像全体を 1 つのカテゴリに分類:

  • 入力: 画像
  • 出力: クラスラベル
  • 例: 猫、犬、車
  • ベンチマーク: ImageNet

2. Object Detection(物体検出)

画像内の物体の位置(バウンディングボックス)とクラスを検出:

  • 入力: 画像
  • 出力: [バウンディングボックス + クラス] のリスト
  • モデル: YOLO、Faster R-CNN、DETR
  • ベンチマーク: COCO

3. Semantic Segmentation(意味的セグメンテーション)

画像の各ピクセルにクラスを割り当てる:

  • 入力: 画像
  • 出力: ピクセル単位のクラスマップ
  • 用途: 自動運転(道路 vs 歩道)、医療(臓器分離)
  • モデル: U-Net、DeepLab、SegFormer

4. Instance Segmentation(インスタンスセグメンテーション)

同じクラスの異なる個体を区別:

  • 入力: 画像
  • 出力: ピクセル単位 + インスタンス ID
  • モデル: Mask R-CNN、SOLO、SAM

5. Panoptic Segmentation

Semantic + Instance の統合:

  • 物体: 個別識別
  • 背景: カテゴリ分類

6. Object Tracking(物体追跡)

動画中の物体を時間方向に追跡:

  • Single Object: MOSSE、SiamFC
  • Multi Object: SORT、DeepSORT、ByteTrack

7. Pose Estimation(姿勢推定)

人物の関節位置を推定:

  • 2D: OpenPose、HRNet
  • 3D: SMPL、VIBE
  • 用途: スポーツ分析、AR フィルタ、動作解析

8. Face Recognition(顔認識)

顔の検出と識別:

  • 顔検出: MTCNN、RetinaFace
  • 顔認識: FaceNet、ArcFace
  • 用途: 認証、写真整理

9. Optical Character Recognition(OCR)

画像中の文字を認識:

  • シーンテキスト: 自然画像中の文字
  • 文書 OCR: スキャン文書
  • ツール: Tesseract、PaddleOCR、EasyOCR

10. Image Generation(画像生成)

テキスト等から画像を生成:

  • GAN: StyleGAN
  • Diffusion Model: Stable Diffusion、DALL-E、Midjourney

技術の進化

古典的手法(〜2012)

  • 特徴量: SIFT、HOG、SURF
  • 分類器: SVM、Random Forest
  • 手法: Bag of Words、DPM

CNN 時代(2012〜2020)

  • 2012: AlexNet(ImageNet 優勝)
  • 2014: VGG、GoogLeNet
  • 2015: ResNet(152 層)
  • 2017: SENet
  • 2019: EfficientNet

Transformer 時代(2020〜)

  • 2020: Vision Transformer(ViT)
  • 2021: Swin Transformer、DeiT
  • 2022: Stable Diffusion、DALL-E 2
  • 2023: SAM(Segment Anything)
  • 2024: Sora(動画生成)

代表的なデータセット

データセットタスクサイズ
ImageNet分類1,400 万枚、1,000 クラス
COCO検出・セグ33 万枚、80 クラス
Pascal VOC検出・セグ1 万枚
Cityscapesセグ(都市)25,000 枚
Open Images検出900 万枚
LVIS長尾分布16 万枚
ADE20Kセグ22,000 枚
CelebA顔20 万枚
LFW顔認識13,000 枚
KITTI自動運転15,000 枚

主要なフレームワーク・ライブラリ

汎用

  • OpenCV: 画像処理の基本ライブラリ
  • PIL/Pillow: Python 画像処理
  • scikit-image: 科学計算向け

深層学習

  • PyTorch + torchvision: 最も人気
  • TensorFlow + Keras: 企業向け
  • Detectron2: Meta 製、検出・セグ
  • MMDetection: OpenMMLab、検出
  • MMSegmentation: セグメンテーション
  • Ultralytics: YOLO 系

高レベル

  • Hugging Face Transformers: ViT、CLIP、SAM
  • timm: PyTorch Image Models
  • SuperGradients: Deci、本番向け
  • PaddleDetection: Baidu 製

応用分野

自動運転

  • レーン検出: 道路の車線
  • 物体検出: 車、歩行者、信号
  • セマンティックセグ: 走行可能領域
  • 深度推定: 3D 空間把握

医療

  • X 線・CT 診断: 腫瘍検出
  • 病理画像: がん細胞識別
  • 網膜画像: 糖尿病性網膜症
  • 手術支援: リアルタイム解析

製造業

  • 外観検査: 不良品検出
  • ロボットビジョン: ピック&プレース
  • 品質管理: 製品寸法測定
  • 安全管理: ヘルメット確認

小売

  • 商品認識: セルフレジ
  • 在庫管理: 棚監視
  • 顧客分析: 動線追跡
  • 試着 AR: バーチャル試着

セキュリティ

  • 顔認証: 入退室管理
  • 異常検知: 侵入者検出
  • 行動分析: 不審行動
  • ナンバープレート認識

エンターテインメント

  • AR フィルタ: Instagram、TikTok
  • 動画編集: 自動切り抜き
  • ゲーム: モーションキャプチャ
  • VR: 手のトラッキング

農業

  • 作物監視: ドローン撮影解析
  • 収穫時期判定
  • 害虫検出
  • 雑草除去

宇宙・地理

  • 衛星画像解析
  • 地図生成
  • 災害検出
  • 気象予測

自作 PC での CV 開発

必要スペック

用途GPUVRAM
学習入門RTX 40608GB
標準学習RTX 4070 Ti16GB
大規模学習RTX 409024GB
研究用途A10040-80GB

インストール例

# 基本
pip install opencv-python torch torchvision

# 検出
pip install ultralytics  # YOLO

# 高度なモデル
pip install transformers  # ViT、CLIP、SAM
pip install timm  # モデル集

# OCR
pip install paddlepaddle paddleocr

# 追加ライブラリ
pip install albumentations  # データ拡張
pip install kornia  # 微分可能画像処理

サンプルコード(物体検出)

from ultralytics import YOLO

# モデルロード
model = YOLO('yolo11n.pt')

# 画像で推論
results = model('image.jpg')

# 結果の可視化
for r in results:
    r.show()

# Webcam リアルタイム
results = model(0, show=True)

計算リソースの要件

推論(FPS)

モデルGPUFPS
YOLOv11nRTX 4060200+
ResNet-50RTX 4070500+
ViT-BaseRTX 4070300
Mask R-CNNRTX 409030
SAMRTX 40905-10

学習時間(目安)

モデルデータGPU時間
ResNet-50ImageNetRTX 40903-5 日
YOLOv11mCOCORTX 40901-2 日
ViT-BaseImageNet-21KRTX 40901-2 週間

関連用語

  • CNN、ResNet、EfficientNet
  • ViT、Swin Transformer
  • YOLO、Faster R-CNN、DETR
  • U-Net、DeepLab、SAM
  • Stable Diffusion、DALL-E
この記事について
カテゴリーAI・機械学習
難易度初級
作成日2025/7/11