AI・機械学習
上級
AGUVIS(アグビス)
HKU(香港大学)が2024年に発表した純粋視覚ベースの自律GUI操作エージェント。LLM依存のDOM解析を排除し、スクリーンショットのみで72Bビジョンモデルを使ってOSレベルの複雑タスクを実行する。
0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
gui-agent
autonomous-agent
multimodal-llm
self-reflection
hku
computer-use
AGUVIS とは
AGUVIS(Autonomous GUI Visual agentS)は2024年11月に香港大学(HKU)のチームがarXivで発表した自律GUI操作エージェントフレームワーク。最大の特徴は「Pure Vision」アプローチ:DOMツリー・HTMLソース・アクセシビリティAPI等のテキスト情報を一切使わず、スクリーンショット画像だけからすべての操作を決定する。
なぜ純粋視覚ベースか
従来のGUI Agentは精度向上のためにDOMやHTMLを補助入力として使うことが多い。しかしこのアプローチには限界がある:
- DOM取得不可能なシナリオ: PDFビューア・ゲーム・埋め込みiFrameなど
- DOM構造の複雑化: SPA・Shadow DOMなどでDOMが実際のUIと乖離
- プラットフォーム非汎用: iOSアプリにはDOMが存在しない
AGUVISは視覚のみに絞ることで、あらゆるUIを人間と同じインターフェースで操作できる普遍性を獲得した。
3層アーキテクチャ
┌─────────────────────────────────────┐
│ Layer 1: Planning(グローバル計画) │
│ タスク分解→サブゴール列挙→優先順位付け │
├─────────────────────────────────────┤
│ Layer 2: Execution(局所操作生成) │
│ スクリーンショット→操作タイプ+座標生成 │
├─────────────────────────────────────┤
│ Layer 3: Self-Reflection(自己反省) │
│ 操作後→成功/失敗判定→リトライ戦略変更 │
└─────────────────────────────────────┘
すべてのLayerを単一の72Bビジョンモデル(Qwen2-VL-72B相当)が担う。
ベンチマーク実績(2024年11月時点)
| ベンチマーク | スコア | 比較 |
|---|---|---|
| AndroidWorld | 60.6% | 従来SOTA: AppAgent 49.5% |
| OSWorld(部分) | 17.1% | GPT-4V: 11.9% |
| ScreenSpot | 84.4% | 発表時最高水準 |
学習データ構築
既存GUI操作データセット(AITW・MoTIF・AMEX・OmniAct)から視覚観察→操作の(s, a)ペアを抽出し、さらにGPT-4Vによる合成データでデータ拡張。計約650KのV→A(Vision→Action)ペアで学習。
実用上の意義
72Bモデルが必要なため推論コストは高いが、クローズドAPIへの依存がゼロという点で企業のプライバシー要件に適合しやすい。ローカルGPUサーバー上でセキュアに動作するGUI自動化基盤として注目される。