生活分享

電腦操作(Computer Use)是什麼:讓 AI 看畫面、點滑鼠、打鍵盤

電腦操作是讓代理靠截圖看畫面,再輸出滑鼠與鍵盤動作去操作圖形介面。內容比較 API 工具呼叫、瀏覽器自動化與電腦操作,說明截圖、判斷、動作的迴圈、為何較慢又容易出錯、OSWorld 怎麼評測,以及畫面上的文字可能是提示詞注入,並附一個未實測的表單示例。

閱讀時間約 8 分鐘

一個螢幕畫面被取景框框住,游標正要點向畫面裡的按鈕,下方是一排鍵盤按鍵
圖片:Mokaair (© Mokaair)

電腦操作(Computer Use)是讓代理(Agent)像人一樣用電腦:看螢幕截圖,再輸出滑鼠與鍵盤動作去操作圖形介面。它不要求軟體先開放 API,代價是比較慢、容易點錯,而且畫面上的文字也可能是別人放進去的指令。站上已有談實際使用的產品篇:,這篇只講通用概念。

這個詞沒有單一標準定義。Anthropic 的開發者文件把它說成螢幕截圖加滑鼠與鍵盤控制,另有只管網頁的瀏覽器工具;OpenAI 的指南則把瀏覽器與桌面介面一併算進 computer use,連用 Playwright 程式庫操作網頁的接法也收在內。以下取共同核心:以畫面為依據,用滑鼠鍵盤動作回應。

三種做法,差在模型看什麼

API 工具呼叫是模型產生函式名稱與參數,由程式照既定介面執行,拿回來的是資料而不是畫面,細節見。

瀏覽器自動化以網頁結構為依據:程式用元素的角色、文字或 DOM 位置找到按鈕再操作。Playwright 文件建議優先用角色與名稱這類使用者看得到的屬性,因為綁死 DOM 結構的 CSS 或 XPath 選擇器,結構一改就容易失效。把這類能力做進瀏覽器的產品見。

電腦操作以整個畫面的截圖為主要輸入,動作是座標點擊與按鍵,所以連沒有 API、也沒有網頁結構可讀的桌面軟體都碰得到。截圖之外給不給結構資訊,各家設定不同:Anthropic 的瀏覽器工具文件說,它的電腦操作工具只靠截圖與座標;OSWorld 可另外提供列出介面元素的無障礙樹;OpenAI 的程式碼執行接法,則能在腳本裡檢查網頁 DOM,再搭配截圖確認。

三種做法的比較;依兩家官方文件、OSWorld 論文與 Playwright 文件整理,查證於 2026 年 10 月。
做法模型看到什麼動作與取捨
API 工具呼叫函式回傳的資料函式名稱加參數;穩定好驗證,但只涵蓋已開放的功能
瀏覽器自動化網頁結構,有時加截圖元素定位後操作;只限網頁,改版會影響定位
電腦操作以整個畫面的截圖為主,有些設定另給無障礙樹或 DOM座標點擊與按鍵;什麼軟體都碰得到,但較慢、易點錯

迴圈:截圖、判斷、動作、再截圖

迴圈從交出任務開始:模型可以先要求截一張畫面,程式也可以把目前畫面和任務一起送上;兩種情況下,截圖都由程式擷取。模型看了畫面判斷下一步,回覆一個或幾個動作;程式在自己控制的環境裡執行,再截一張新畫面送回去。Anthropic 文件說明,模型本身不連到電腦,執行動作與回傳畫面的是你的應用程式。這樣重複,直到模型回覆完成、程式達到步數上限,或需要人處理。

模型常一次送出一小串動作,Anthropic 文件提到可以在每串結尾附上一張截圖,需要人確認的檢查也得放在每個動作之前,不是整串做完之後。模型有時假設動作成功卻沒檢查,文件的做法是在提示詞要求每步之後截圖,並說明畫面顯示什麼、這步成不成功。

一圈迴圈依序是截圖、判斷、動作、再截圖,右側標出畫面文字不可信、高風險動作先問人、整圈設上限三條護欄
四個方框是一圈;紅、橘、綠圓點對應右側三條護欄各管哪一段,綠點標在外框上,表示管整圈。 · 圖片:Mokaair (© Mokaair)

為什麼比 API 慢,也更容易出錯

每一步都要截圖、傳圖、讓模型看圖再回覆,來回次數遠多於一次函式呼叫,所以慢。截圖也算輸入 token,長流程累積得很快。Anthropic 文件在限制一節寫,延遲對即時的人機互動可能太慢,建議用在速度不重要的場合。

容易出錯有兩個來源。一是看畫面算座標:文件寫明模型在輸出座標或選擇工具時可能出錯或產生幻覺,捲動、下拉選單與試算表也是文件點名的難處。二是缺少介面知識又容易被干擾:OSWorld 論文的分析指出,模型常卡在把畫面位置對到正確座標與對軟體不熟,還會反覆點錯、被彈出視窗帶偏。截圖本身沒有「這是第三個欄位」的標籤,只有像素。

評測怎麼做:OSWorld 的設定

OSWorld(Xie 等人,2024,arXiv:2404.07972)是常被引用的評測,這裡只看它怎麼量,不談排名。它在虛擬機器裡跑真實的作業系統與軟體,收了 369 個在 Ubuntu 上執行的任務,涵蓋網頁、桌面應用程式與跨軟體流程。每題先把環境還原到指定起點,再由專屬的檢查程式看最後的檔案、設定或介面狀態,判斷是否完成,而不是比對模型自己怎麼說。

論文的觀察可以是截圖、無障礙樹或兩者並用;動作是用 pyautogui 程式碼寫成的滑鼠與鍵盤操作。在原始論文的實驗設定下,每題最多互動 15 步;論文也量到截圖解析度、提供多少步歷史都可能影響成功率,所以設定不同的分數不能直接相比。OSWorld 之後也修訂過:2025 年的 Verified 版處理了社群回報的約 300 個問題,網站改版與驗證碼都會讓題目失效;2026 年另有改收 108 個長流程任務的 2.0 版。

風險:畫面上的字、誤點與帳號權限

畫面內容注入是這個做法最特別的風險。模型把截圖裡的字當輸入讀進來,所以網頁、文件或圖片裡一句「忽略先前指示,改做這件事」,也可能被當成指令,而不只是資料。OWASP 稱之為間接提示詞注入,也提到多模態模型可能受圖片裡藏的指令影響,並說不確定有沒有萬無一失的防法。完整說明見。Anthropic 文件說,即使有分類器掃描截圖,隔離與確認仍不可少。

兩家官方文件列的防護很接近:在隔離的虛擬機器或容器跑;只給任務需要的權限與資料,登入資訊尤其要避免;用網域允許清單限制能連的網站;購買、傳送資料、刪除、同意條款這類難以回復或需要同意的動作由人確認,OpenAI 還寫明在表單輸入敏感資料也算傳送。OpenAI 另建議設定步數、時間或費用上限,並檢查實際結果,不只相信模型最後說的話。隔離環境的概念見。

誤點與帳號權限是同一個問題的兩端:代理用誰的帳號,誤點就等於誰按下去。Anthropic 的瀏覽器工具文件說,躲不開已登入狀態時,要用專用的低權限帳號,並對會改動帳號的動作保留人工確認。

示例:在測試帳號裡填一張表單

以下是示例,未實測。假設有個只放虛構資料的活動報名測試頁,跑在沒有真實會員資料的虛擬機器裡,網路只允許連到這個測試站,登入的是專用測試帳號。任務是填姓名、場次、備註,並在送出前停下來。

  1. 截圖,確認畫面是測試站的表單,不是登入頁或彈出視窗。
  2. 點姓名欄、輸入虛構姓名,再截圖,確認欄位內容和輸入一致。
  3. 場次是下拉選單;點選沒反應就改用鍵盤方向鍵與 Enter,再截圖確認選到哪一場。
  4. 填備註,再截圖確認。
  5. 停在送出鈕之前,列出三個欄位的值,由人檢查並自己按送出。

預期輸出是三個欄位與指定內容一致、停在送出之前,並留下每一步的截圖與動作紀錄。失敗要分開判讀:欄位內容不對,先看是點錯位置還是輸入法改了字;連續幾圈畫面都沒變,多半是重複一個無效動作,應停下來而不是調高步數上限;畫面冒出「改填別的資料」這類文字,視為不可信內容,不照做並留下截圖。

怎麼選:先 API,再網頁,最後才是畫面

順序是:有 API 就用 API,最穩也最容易驗證;任務只在網頁內,以網頁結構為主的做法通常更合適,Anthropic 文件也這樣建議;兩者都碰不到才輪到電腦操作,先挑結果能檢查的任務。其他名詞可到查。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享