AI・機械学習
上級

AGUVIS(アグビス)

HKU(香港大学)が2024年に発表した純粋視覚ベースの自律GUI操作エージェント。LLM依存のDOM解析を排除し、スクリーンショットのみで72Bビジョンモデルを使ってOSレベルの複雑タスクを実行する。

0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
gui-agent
autonomous-agent
multimodal-llm
self-reflection
hku
computer-use

AGUVIS とは

AGUVIS(Autonomous GUI Visual agentS)は2024年11月に香港大学(HKU)のチームがarXivで発表した自律GUI操作エージェントフレームワーク。最大の特徴は「Pure Vision」アプローチ:DOMツリー・HTMLソース・アクセシビリティAPI等のテキスト情報を一切使わず、スクリーンショット画像だけからすべての操作を決定する。

なぜ純粋視覚ベースか

従来のGUI Agentは精度向上のためにDOMやHTMLを補助入力として使うことが多い。しかしこのアプローチには限界がある:

  1. DOM取得不可能なシナリオ: PDFビューア・ゲーム・埋め込みiFrameなど
  2. DOM構造の複雑化: SPA・Shadow DOMなどでDOMが実際のUIと乖離
  3. プラットフォーム非汎用: iOSアプリにはDOMが存在しない

AGUVISは視覚のみに絞ることで、あらゆるUIを人間と同じインターフェースで操作できる普遍性を獲得した。

3層アーキテクチャ

┌─────────────────────────────────────┐
│ Layer 1: Planning(グローバル計画)   │
│   タスク分解→サブゴール列挙→優先順位付け │
├─────────────────────────────────────┤
│ Layer 2: Execution(局所操作生成)   │
│   スクリーンショット→操作タイプ+座標生成 │
├─────────────────────────────────────┤
│ Layer 3: Self-Reflection(自己反省)  │
│   操作後→成功/失敗判定→リトライ戦略変更 │
└─────────────────────────────────────┘

すべてのLayerを単一の72Bビジョンモデル(Qwen2-VL-72B相当)が担う。

ベンチマーク実績(2024年11月時点)

ベンチマークスコア比較
AndroidWorld60.6%従来SOTA: AppAgent 49.5%
OSWorld(部分)17.1%GPT-4V: 11.9%
ScreenSpot84.4%発表時最高水準

学習データ構築

既存GUI操作データセット(AITW・MoTIF・AMEX・OmniAct)から視覚観察→操作の(s, a)ペアを抽出し、さらにGPT-4Vによる合成データでデータ拡張。計約650KのV→A(Vision→Action)ペアで学習。

実用上の意義

72Bモデルが必要なため推論コストは高いが、クローズドAPIへの依存がゼロという点で企業のプライバシー要件に適合しやすい。ローカルGPUサーバー上でセキュアに動作するGUI自動化基盤として注目される。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/8