AI・機械学習
初級
Computer Vision(コンピュータービジョン)
Computer Visionは、人工知能・機械学習分野における重要な概念・技術です。
0 回閲覧
0 いいね
2026/4/25 更新
関連タグ
AI
機械学習
初心者向け
Computer Vision(コンピュータビジョン)
概要
Computer Vision(コンピュータビジョン、CV)は、コンピュータに画像や動画を「見る」能力を与え、視覚情報から意味のある情報を抽出・理解・判断する技術分野です。1960 年代から研究されてきましたが、2012 年の AlexNet による深層学習革命以降、急速に発展し、現代では自動運転、医療診断、顔認証、産業検査、AR/VR など社会インフラを支える基盤技術となっています。
主要なタスク
1. Image Classification(画像分類)
画像全体を 1 つのカテゴリに分類:
- 入力: 画像
- 出力: クラスラベル
- 例: 猫、犬、車
- ベンチマーク: ImageNet
2. Object Detection(物体検出)
画像内の物体の位置(バウンディングボックス)とクラスを検出:
- 入力: 画像
- 出力: [バウンディングボックス + クラス] のリスト
- モデル: YOLO、Faster R-CNN、DETR
- ベンチマーク: COCO
3. Semantic Segmentation(意味的セグメンテーション)
画像の各ピクセルにクラスを割り当てる:
- 入力: 画像
- 出力: ピクセル単位のクラスマップ
- 用途: 自動運転(道路 vs 歩道)、医療(臓器分離)
- モデル: U-Net、DeepLab、SegFormer
4. Instance Segmentation(インスタンスセグメンテーション)
同じクラスの異なる個体を区別:
- 入力: 画像
- 出力: ピクセル単位 + インスタンス ID
- モデル: Mask R-CNN、SOLO、SAM
5. Panoptic Segmentation
Semantic + Instance の統合:
- 物体: 個別識別
- 背景: カテゴリ分類
6. Object Tracking(物体追跡)
動画中の物体を時間方向に追跡:
- Single Object: MOSSE、SiamFC
- Multi Object: SORT、DeepSORT、ByteTrack
7. Pose Estimation(姿勢推定)
人物の関節位置を推定:
- 2D: OpenPose、HRNet
- 3D: SMPL、VIBE
- 用途: スポーツ分析、AR フィルタ、動作解析
8. Face Recognition(顔認識)
顔の検出と識別:
- 顔検出: MTCNN、RetinaFace
- 顔認識: FaceNet、ArcFace
- 用途: 認証、写真整理
9. Optical Character Recognition(OCR)
画像中の文字を認識:
- シーンテキスト: 自然画像中の文字
- 文書 OCR: スキャン文書
- ツール: Tesseract、PaddleOCR、EasyOCR
10. Image Generation(画像生成)
テキスト等から画像を生成:
- GAN: StyleGAN
- Diffusion Model: Stable Diffusion、DALL-E、Midjourney
技術の進化
古典的手法(〜2012)
- 特徴量: SIFT、HOG、SURF
- 分類器: SVM、Random Forest
- 手法: Bag of Words、DPM
CNN 時代(2012〜2020)
- 2012: AlexNet(ImageNet 優勝)
- 2014: VGG、GoogLeNet
- 2015: ResNet(152 層)
- 2017: SENet
- 2019: EfficientNet
Transformer 時代(2020〜)
- 2020: Vision Transformer(ViT)
- 2021: Swin Transformer、DeiT
- 2022: Stable Diffusion、DALL-E 2
- 2023: SAM(Segment Anything)
- 2024: Sora(動画生成)
代表的なデータセット
| データセット | タスク | サイズ |
|---|---|---|
| ImageNet | 分類 | 1,400 万枚、1,000 クラス |
| COCO | 検出・セグ | 33 万枚、80 クラス |
| Pascal VOC | 検出・セグ | 1 万枚 |
| Cityscapes | セグ(都市) | 25,000 枚 |
| Open Images | 検出 | 900 万枚 |
| LVIS | 長尾分布 | 16 万枚 |
| ADE20K | セグ | 22,000 枚 |
| CelebA | 顔 | 20 万枚 |
| LFW | 顔認識 | 13,000 枚 |
| KITTI | 自動運転 | 15,000 枚 |
主要なフレームワーク・ライブラリ
汎用
- OpenCV: 画像処理の基本ライブラリ
- PIL/Pillow: Python 画像処理
- scikit-image: 科学計算向け
深層学習
- PyTorch + torchvision: 最も人気
- TensorFlow + Keras: 企業向け
- Detectron2: Meta 製、検出・セグ
- MMDetection: OpenMMLab、検出
- MMSegmentation: セグメンテーション
- Ultralytics: YOLO 系
高レベル
- Hugging Face Transformers: ViT、CLIP、SAM
- timm: PyTorch Image Models
- SuperGradients: Deci、本番向け
- PaddleDetection: Baidu 製
応用分野
自動運転
- レーン検出: 道路の車線
- 物体検出: 車、歩行者、信号
- セマンティックセグ: 走行可能領域
- 深度推定: 3D 空間把握
医療
- X 線・CT 診断: 腫瘍検出
- 病理画像: がん細胞識別
- 網膜画像: 糖尿病性網膜症
- 手術支援: リアルタイム解析
製造業
- 外観検査: 不良品検出
- ロボットビジョン: ピック&プレース
- 品質管理: 製品寸法測定
- 安全管理: ヘルメット確認
小売
- 商品認識: セルフレジ
- 在庫管理: 棚監視
- 顧客分析: 動線追跡
- 試着 AR: バーチャル試着
セキュリティ
- 顔認証: 入退室管理
- 異常検知: 侵入者検出
- 行動分析: 不審行動
- ナンバープレート認識
エンターテインメント
- AR フィルタ: Instagram、TikTok
- 動画編集: 自動切り抜き
- ゲーム: モーションキャプチャ
- VR: 手のトラッキング
農業
- 作物監視: ドローン撮影解析
- 収穫時期判定
- 害虫検出
- 雑草除去
宇宙・地理
- 衛星画像解析
- 地図生成
- 災害検出
- 気象予測
自作 PC での CV 開発
必要スペック
| 用途 | GPU | VRAM |
|---|---|---|
| 学習入門 | RTX 4060 | 8GB |
| 標準学習 | RTX 4070 Ti | 16GB |
| 大規模学習 | RTX 4090 | 24GB |
| 研究用途 | A100 | 40-80GB |
インストール例
# 基本
pip install opencv-python torch torchvision
# 検出
pip install ultralytics # YOLO
# 高度なモデル
pip install transformers # ViT、CLIP、SAM
pip install timm # モデル集
# OCR
pip install paddlepaddle paddleocr
# 追加ライブラリ
pip install albumentations # データ拡張
pip install kornia # 微分可能画像処理
サンプルコード(物体検出)
from ultralytics import YOLO
# モデルロード
model = YOLO('yolo11n.pt')
# 画像で推論
results = model('image.jpg')
# 結果の可視化
for r in results:
r.show()
# Webcam リアルタイム
results = model(0, show=True)
計算リソースの要件
推論(FPS)
| モデル | GPU | FPS |
|---|---|---|
| YOLOv11n | RTX 4060 | 200+ |
| ResNet-50 | RTX 4070 | 500+ |
| ViT-Base | RTX 4070 | 300 |
| Mask R-CNN | RTX 4090 | 30 |
| SAM | RTX 4090 | 5-10 |
学習時間(目安)
| モデル | データ | GPU | 時間 |
|---|---|---|---|
| ResNet-50 | ImageNet | RTX 4090 | 3-5 日 |
| YOLOv11m | COCO | RTX 4090 | 1-2 日 |
| ViT-Base | ImageNet-21K | RTX 4090 | 1-2 週間 |
関連用語
- CNN、ResNet、EfficientNet
- ViT、Swin Transformer
- YOLO、Faster R-CNN、DETR
- U-Net、DeepLab、SAM
- Stable Diffusion、DALL-E