← 返回首頁
LESSON 046AI 開發9 分鐘

Computer Use 是什麼?AI 怎麼看螢幕、點按鈕、填表單,甚至操作沒有 API 的軟體

Computer Use 讓模型透過 Screenshot、Mouse、Keyboard 等介面操作 GUI。這篇說明 Perception → Action Loop、Browser Agent 的關係、限制與安全邊界。

今天用這個比喻API 像拿到餐廳內部點餐系統;Computer Use 則像讓助理坐到任何電腦前,直接看畫面、移滑鼠、按鍵盤完成工作

Lesson 045 講的是 AI 在 Browser 裡操作網站。

但如果目標不是網頁,而是一個桌面軟體呢?

例如:

這時會碰到 Computer Use(電腦操作能力)。

Computer Use 的核心是 GUI

圖形使用者介面(Graphical User Interface, GUI) 就是你平常看到的視窗、按鈕、選單、文字欄位。

Computer Use Agent 的基本想法是:

看畫面
→ 理解現在在哪裡
→ 決定下一步
→ 點擊 / 輸入 / 捲動
→ 再看新畫面
→ 繼續

它是一個反覆的 Perception → Action Loop(感知 → 行動迴圈)。

Screenshot 是 Agent 的「眼睛」之一

很多 Computer Use 系統會取得 Screenshot(螢幕截圖),讓視覺模型判斷:

接著 Agent 再輸出 Action:

click(x, y)
type("hello")
scroll(0, 600)

實際系統不一定使用完全相同格式,但概念就是把畫面理解轉成滑鼠與鍵盤動作。

這和 API 最大差別在哪?

Lesson 018:API 的優勢是結構化。

API 可能直接說:

{
  "action": "create_calendar_event",
  "date": "2026-09-12",
  "time": "15:00"
}

Computer Use 則可能要:

打開 Calendar
→ 找 Create
→ 點日期
→ 填時間
→ 填標題
→ 按 Save

所以 API 通常:

Computer Use 的強項則是通用性。

為什麼 GUI Agent 比想像中難?

人類看畫面很自然,但電腦介面充滿例外:

只要一步做錯,後面的狀態就可能全部不同。

所以 Agent 必須一直重新觀察

不能假設:

我剛剛點了 Save
→ 一定成功

更好的 Agent Loop 是:

點 Save
→ 再看畫面
→ 確認是否真的出現 Success
→ 若沒有,診斷原因

這和一般 Automation Script 最大差別之一,就是 Agent 可以根據新畫面動態調整。

Computer Use 的安全風險也更直接

Lesson 035:Prompt Injection 在這裡會更嚴重。

因為 Agent 不只「看到」惡意內容,還可能擁有:

所以應用程式要限制:

最重要:不要把桌面操作權限等同「全部權限」

Computer Use 最安全的做法不是把整台個人電腦毫無限制交出去。

而是盡量:

這和 Lesson 036 的 Defense in Depth 完全一致:安全不能只靠模型自己「答應不做壞事」。

一句話帶走

Computer Use 讓 AI 透過 Screenshot 看 GUI,再用滑鼠與鍵盤反覆操作。它比 API 更通用,能處理沒有結構化介面的軟體,但也更容易受 UI 變動、錯誤狀態與 Prompt Injection 影響,所以需要隔離、最小權限與確認機制。

正式資料來源

比喻是理解入口;正式定義與細節請以原始資料為準。

  1. OpenAI API — Computer use ↗
  2. OpenAI — Using cloud browser in ChatGPT ↗
  3. Anthropic — Computer use tool ↗
← 上一章045AI Browser 是什麼?會自己點網頁的 AI,和只會回答問題的 Chatbot 差在哪
下一章 →047MCP 是什麼?像替 AI 工具接上一種共通插座,讓模型更容易連資料與外部能力
COMMUNITY

留言

有想法、疑問或想補充的地方,都可以留在這裡。

0 / 1200