Lesson 045ではBrowser上のWeb操作を説明しました。
では対象がDesktop Appや古い業務Systemで、便利なAPIがない場合はどうでしょうか。
そこで使われるのが**Computer Use(コンピュータ操作能力)**です。
GUIを直接操作する
**Graphical User Interface(GUI、グラフィカルユーザーインターフェース)**はWindow、Button、Menu、Text Fieldなど人が見る画面です。
Computer Use Agentは:
画面を見る
→ 現在Stateを理解
→ 次のActionを決める
→ Click / Type / Scroll
→ 新しい画面を見る
→ 続ける
という**Perception → Action Loop(知覚→行動ループ)**を繰り返します。
Screenshotが「目」になる
SystemがScreenshotをModelへ渡し、Vision能力でButton、Field、Error Messageを認識します。
次に概念的には:
click(x, y)
type("hello")
scroll(0, 600)
のようなActionをToolへ返します。
APIがあるなら通常はAPIが有利
Lesson 018のAPIなら、Calendar Eventを一つの構造化Requestで作れるかもしれません。
GUIではAppを開き、Createを探し、日付を選び、入力してSaveする必要があります。
APIは一般に:
- 安定
- 高速
- Permission設定が明確
- Layout変更に強い
という利点があります。
Computer Useの強みは**Generality(汎用性)**です。
GUI Agentは意外に壊れやすい
Popup、Loading、Resolution、Dark Mode、Button位置、Focus、Drag-and-dropなど、小さな変化でStateが変わります。
一手間違えると後続Action全部がずれる可能性があります。
Action後は必ず再観察する
SaveをClickした → 成功したはず
ではなく、次のScreenを見てSuccess Stateが本当に出たか確認するLoopが必要です。
Security Riskはより直接的
Lesson 035のPrompt Injectionに加え、AgentがClick、Upload、Download、Send、Deleteできる場合、実世界への影響が大きくなります。
利用可能App、File、入力Data、Confirmation対象、Sandboxを制限します。
Lesson 036のDefense in Depthと同じ考え方です。
ひとことで
Computer UseはAIがGUIを見てMouseとKeyboardで反復操作する能力です。APIがないSoftwareにも届きますが、UI変化とSecurity Riskが大きいため、Sandbox、Least Privilege、Action後の検証が重要です。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。