← ホームへ戻る
LESSON 046AI開発9 分

Computer Useとは?AIがScreenを見てMouseとKeyboardでGUIを操作する仕組み

Computer Use AgentはScreenshotを見て、Mouse、Keyboard、ScrollなどでGUIを操作します。Perception→Action Loop、APIとの違い、Securityを説明します。

今日のたとえAPIが内部受付窓口なら、Computer Useは助手を実際のPC前に座らせ、画面を見ながらMouseとKeyboardを使わせる方法です。

Lesson 045ではBrowser上のWeb操作を説明しました。

では対象がDesktop Appや古い業務Systemで、便利なAPIがない場合はどうでしょうか。

そこで使われるのが**Computer Use(コンピュータ操作能力)**です。

GUIを直接操作する

**Graphical User Interface(GUI、グラフィカルユーザーインターフェース)**はWindow、Button、Menu、Text Fieldなど人が見る画面です。

Computer Use Agentは:

画面を見る
→ 現在Stateを理解
→ 次のActionを決める
→ Click / Type / Scroll
→ 新しい画面を見る
→ 続ける

という**Perception → Action Loop(知覚→行動ループ)**を繰り返します。

Screenshotが「目」になる

SystemがScreenshotをModelへ渡し、Vision能力でButton、Field、Error Messageを認識します。

次に概念的には:

click(x, y)
type("hello")
scroll(0, 600)

のようなActionをToolへ返します。

APIがあるなら通常はAPIが有利

Lesson 018のAPIなら、Calendar Eventを一つの構造化Requestで作れるかもしれません。

GUIではAppを開き、Createを探し、日付を選び、入力してSaveする必要があります。

APIは一般に:

という利点があります。

Computer Useの強みは**Generality(汎用性)**です。

GUI Agentは意外に壊れやすい

Popup、Loading、Resolution、Dark Mode、Button位置、Focus、Drag-and-dropなど、小さな変化でStateが変わります。

一手間違えると後続Action全部がずれる可能性があります。

Action後は必ず再観察する

SaveをClickした → 成功したはず

ではなく、次のScreenを見てSuccess Stateが本当に出たか確認するLoopが必要です。

Security Riskはより直接的

Lesson 035のPrompt Injectionに加え、AgentがClick、Upload、Download、Send、Deleteできる場合、実世界への影響が大きくなります。

利用可能App、File、入力Data、Confirmation対象、Sandboxを制限します。

Lesson 036のDefense in Depthと同じ考え方です。

ひとことで

Computer UseはAIがGUIを見てMouseとKeyboardで反復操作する能力です。APIがないSoftwareにも届きますが、UI変化とSecurity Riskが大きいため、Sandbox、Least Privilege、Action後の検証が重要です。

参考資料

たとえは直感をつかむ入口です。正式な定義や技術詳細は原典をご確認ください。

  1. OpenAI API — Computer use ↗
  2. OpenAI — Using cloud browser in ChatGPT ↗
  3. Anthropic — Computer use tool ↗
← 前の章045AI Browserとは?Webを読むだけでなく、AIがClick・入力・ページ移動まで行うBrowser Agent
次の章 →047MCPとは?AI ApplicationとTool・外部Contextをつなぐ共通ポートのようなProtocol
COMMUNITY

コメント

質問、感想、補足したいことがあれば、ここに残せます。

0 / 1200