AI・機械学習
中級
AppAgent(アップエージェント)
TencentとPKU(北京大学)が2023年に発表したGPT-4V駆動のスマートフォン操作エージェント。Android ADB経由でタップ・スワイプ・入力操作を自律実行し、自己探索フェーズで操作ドキュメントを自動生成する。
0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
gui-agent
android-agent
gpt-4v
smartphone-automation
tencent
pkuseg
AppAgent とは
AppAgentは2023年12月にTencent AILab・北京大学(PKU)のチームがarXivで発表したAndroidスマートフォン操作マルチモーダルエージェント。GPT-4Vの視覚理解能力とAndroid Debug Bridge(ADB)を組み合わせ、実機またはエミュレータ上のアプリを自律的に操作する。
2フェーズ設計
Phase 1: 自己探索(Autonomous Exploration)
空のアプリ起動
→ GPT-4V がランダムにUI要素をタップ
→ 操作前後のスクリーンショット差分を分析
→ 「このボタンは〇〇画面に遷移する」等の
操作ドキュメントをJSONに自動記録
→ 全UI要素の網羅的ドキュメント完成
Phase 2: タスク実行(Task Execution)
ユーザー指示入力(例:「TikTokでフォロワー一覧を開く」)
→ 探索フェーズで生成したドキュメント参照
→ GPT-4V がステップ毎に次操作を決定
→ ADB コマンドで実機操作実行
→ スクリーンショット確認→繰り返し
注釈画像(Annotated Screenshot)
AppAgentの特徴的な入力形式。生のスクリーンショットに各インタラクティブ要素へ番号ラベルを重ねて表示することで、GPT-4Vが「ボタン①をタップ」のように要素を確実に参照できる。DOMやアクセシビリティAPIなしに座標を特定できる。
例: スクリーンショット + オーバーレイ
┌────────────────────────┐
│ [1]検索バー │
│ [2]ホームタブ │
│ [3]フォロー通知 [4]設定 │
└────────────────────────┘
→ GPT-4V: "タスク達成のため [1] をタップ"
→ ADB: adb shell input tap 540 120
実験評価
50の人気Androidアプリ(TikTok・Instagram・Google Maps・Spotify・Chrome等)でタスク達成率を評価。人間デモあり条件では平均89.3%、自己探索のみで74.2%の達成率を記録(2023年時点)。
ADB操作種別
| 操作 | ADB コマンド例 |
|---|---|
| タップ | adb shell input tap x y |
| スワイプ | adb shell input swipe x1 y1 x2 y2 duration |
| テキスト入力 | adb shell input text "text" |
| キー入力 | adb shell input keyevent KEYCODE_BACK |
| スクリーンショット | adb exec-out screencap -p > screen.png |
後継と発展
AppAgentの「注釈画像+自己探索ドキュメント」アプローチはその後多くのGUI Agentに影響を与えた。2024年にはAppAgent v2、MobileAgent等の後継が発表されている。Hugging Faceおよびpaperwithcodeで実装公開済み。