Lesson 045 講的是 AI 在 Browser 裡操作網站。
但如果目標不是網頁,而是一個桌面軟體呢?
例如:
- 舊版 ERP
- 圖形化設定工具
- 沒有 API 的內部系統
- 桌面 App
這時會碰到 Computer Use(電腦操作能力)。
Computer Use 的核心是 GUI
圖形使用者介面(Graphical User Interface, GUI) 就是你平常看到的視窗、按鈕、選單、文字欄位。
Computer Use Agent 的基本想法是:
看畫面
→ 理解現在在哪裡
→ 決定下一步
→ 點擊 / 輸入 / 捲動
→ 再看新畫面
→ 繼續
它是一個反覆的 Perception → Action Loop(感知 → 行動迴圈)。
Screenshot 是 Agent 的「眼睛」之一
很多 Computer Use 系統會取得 Screenshot(螢幕截圖),讓視覺模型判斷:
- 有哪些按鈕
- 表單在哪裡
- 現在是什麼頁面
- 錯誤訊息出現在哪裡
接著 Agent 再輸出 Action:
click(x, y)
type("hello")
scroll(0, 600)
實際系統不一定使用完全相同格式,但概念就是把畫面理解轉成滑鼠與鍵盤動作。
這和 API 最大差別在哪?
Lesson 018:API 的優勢是結構化。
API 可能直接說:
{
"action": "create_calendar_event",
"date": "2026-09-12",
"time": "15:00"
}
Computer Use 則可能要:
打開 Calendar
→ 找 Create
→ 點日期
→ 填時間
→ 填標題
→ 按 Save
所以 API 通常:
- 更穩
- 更快
- 權限更好限制
- 不怕按鈕移位置
Computer Use 的強項則是通用性。
為什麼 GUI Agent 比想像中難?
人類看畫面很自然,但電腦介面充滿例外:
- Button 被 Popup 擋住
- 網頁載入變慢
- 解析度不同
- Dark Mode 改變視覺
- 同一個功能換位置
- 需要 Drag-and-drop
- 滑鼠焦點跑掉
只要一步做錯,後面的狀態就可能全部不同。
所以 Agent 必須一直重新觀察
不能假設:
我剛剛點了 Save
→ 一定成功
更好的 Agent Loop 是:
點 Save
→ 再看畫面
→ 確認是否真的出現 Success
→ 若沒有,診斷原因
這和一般 Automation Script 最大差別之一,就是 Agent 可以根據新畫面動態調整。
Computer Use 的安全風險也更直接
Lesson 035:Prompt Injection 在這裡會更嚴重。
因為 Agent 不只「看到」惡意內容,還可能擁有:
- Click
- Type
- Upload
- Download
- Send
- Delete
所以應用程式要限制:
- 可以操作哪些網站 / App
- 可以讀哪些檔案
- 可以輸入哪些資料
- 哪些動作需要確認
- 哪些環境要 Sandbox
最重要:不要把桌面操作權限等同「全部權限」
Computer Use 最安全的做法不是把整台個人電腦毫無限制交出去。
而是盡量:
- 用隔離 VM / Cloud Environment
- 用低權限帳號
- 只掛載必要資料
- 重要動作要求人工確認
- 記錄 Action Log
這和 Lesson 036 的 Defense in Depth 完全一致:安全不能只靠模型自己「答應不做壞事」。
一句話帶走
Computer Use 讓 AI 透過 Screenshot 看 GUI,再用滑鼠與鍵盤反覆操作。它比 API 更通用,能處理沒有結構化介面的軟體,但也更容易受 UI 變動、錯誤狀態與 Prompt Injection 影響,所以需要隔離、最小權限與確認機制。
留言
有想法、疑問或想補充的地方,都可以留在這裡。
還沒有留言,來當 1F 吧。