生活分享
電腦操作(Computer Use)是什麼:讓 AI 看畫面、點滑鼠、打鍵盤
電腦操作是讓代理靠截圖看畫面,再輸出滑鼠與鍵盤動作去操作圖形介面。內容比較 API 工具呼叫、瀏覽器自動化與電腦操作,說明截圖、判斷、動作的迴圈、為何較慢又容易出錯、OSWorld 怎麼評測,以及畫面上的文字可能是提示詞注入,並附一個未實測的表單示例。
閱讀時間約 8 分鐘

電腦操作(Computer Use)是讓代理(Agent)像人一樣用電腦:看螢幕截圖,再輸出滑鼠與鍵盤動作去操作圖形介面。它不要求軟體先開放 API,代價是比較慢、容易點錯,而且畫面上的文字也可能是別人放進去的指令。站上已有談實際使用的產品篇:Claude 操作電腦是怎麼回事Claude 操作電腦是怎麼回事:能力、限制與安全2026 年 9 月,Claude 的 computer use 是「看螢幕截圖、決定一個動作、執行、再看一次」的循環。這篇說明它和聊天、和一般代理差在哪,一般使用者碰得到的四種形式(桌面版電腦操作、Cowork 內建瀏覽器、Claude in Chrome、開發者走 API)各要什麼條件,用一個查資料整理成表格的任務走一遍流程,並依官方文件列出它做不好的地方與提示詞注入等安全提醒。閱讀全文,這篇只講通用概念。
這個詞沒有單一標準定義。Anthropic 的開發者文件把它說成螢幕截圖加滑鼠與鍵盤控制,另有只管網頁的瀏覽器工具;OpenAI 的指南則把瀏覽器與桌面介面一併算進 computer use,連用 Playwright 程式庫操作網頁的接法也收在內。以下取共同核心:以畫面為依據,用滑鼠鍵盤動作回應。
三種做法,差在模型看什麼
API 工具呼叫是模型產生函式名稱與參數,由程式照既定介面執行,拿回來的是資料而不是畫面,細節見工具呼叫(Tool Calling)工具呼叫(Tool Calling)是什麼:模型如何請程式做事工具呼叫是模型依工具說明產生結構化請求,交由程式執行,再讀取結果的流程;產生參數不等於操作已成功。本文用借用社區器材的情境,說明工具名稱、輸入格式、查詢與寫入的差異,以及為什麼合法 JSON 仍可能包含錯誤內容。附完整往返圖與故障判讀表,幫你看懂代理何時只是提議,何時才有真正的外部結果。閱讀全文。
瀏覽器自動化以網頁結構為依據:程式用元素的角色、文字或 DOM 位置找到按鈕再操作。Playwright 文件建議優先用角色與名稱這類使用者看得到的屬性,因為綁死 DOM 結構的 CSS 或 XPath 選擇器,結構一改就容易失效。把這類能力做進瀏覽器的產品見AI 瀏覽器指南AI 瀏覽器怎麼選:Comet、Dia、Chrome 的 Gemini 與代理風險AI 瀏覽器把助理放進側邊欄,能問目前頁面、整理跨分頁、甚至替你點按操作。這篇照 2026 年 9 月 15 日官網整理 Comet、Dia、Chrome 的 Gemini、Edge 的 Copilot 模式與 Brave Leo 的平台、方案與代理功能,說明 ChatGPT Atlas 已停止運作與接手方案,並拆解提示詞注入、密碼付款與隱私設定三類風險。閱讀全文。
電腦操作以整個畫面的截圖為主要輸入,動作是座標點擊與按鍵,所以連沒有 API、也沒有網頁結構可讀的桌面軟體都碰得到。截圖之外給不給結構資訊,各家設定不同:Anthropic 的瀏覽器工具文件說,它的電腦操作工具只靠截圖與座標;OSWorld 可另外提供列出介面元素的無障礙樹;OpenAI 的程式碼執行接法,則能在腳本裡檢查網頁 DOM,再搭配截圖確認。
| 做法 | 模型看到什麼 | 動作與取捨 |
|---|---|---|
| API 工具呼叫 | 函式回傳的資料 | 函式名稱加參數;穩定好驗證,但只涵蓋已開放的功能 |
| 瀏覽器自動化 | 網頁結構,有時加截圖 | 元素定位後操作;只限網頁,改版會影響定位 |
| 電腦操作 | 以整個畫面的截圖為主,有些設定另給無障礙樹或 DOM | 座標點擊與按鍵;什麼軟體都碰得到,但較慢、易點錯 |
迴圈:截圖、判斷、動作、再截圖
迴圈從交出任務開始:模型可以先要求截一張畫面,程式也可以把目前畫面和任務一起送上;兩種情況下,截圖都由程式擷取。模型看了畫面判斷下一步,回覆一個或幾個動作;程式在自己控制的環境裡執行,再截一張新畫面送回去。Anthropic 文件說明,模型本身不連到電腦,執行動作與回傳畫面的是你的應用程式。這樣重複,直到模型回覆完成、程式達到步數上限,或需要人處理。
模型常一次送出一小串動作,Anthropic 文件提到可以在每串結尾附上一張截圖,需要人確認的檢查也得放在每個動作之前,不是整串做完之後。模型有時假設動作成功卻沒檢查,文件的做法是在提示詞要求每步之後截圖,並說明畫面顯示什麼、這步成不成功。
為什麼比 API 慢,也更容易出錯
每一步都要截圖、傳圖、讓模型看圖再回覆,來回次數遠多於一次函式呼叫,所以慢。截圖也算輸入 token,長流程累積得很快。Anthropic 文件在限制一節寫,延遲對即時的人機互動可能太慢,建議用在速度不重要的場合。
容易出錯有兩個來源。一是看畫面算座標:文件寫明模型在輸出座標或選擇工具時可能出錯或產生幻覺,捲動、下拉選單與試算表也是文件點名的難處。二是缺少介面知識又容易被干擾:OSWorld 論文的分析指出,模型常卡在把畫面位置對到正確座標與對軟體不熟,還會反覆點錯、被彈出視窗帶偏。截圖本身沒有「這是第三個欄位」的標籤,只有像素。
評測怎麼做:OSWorld 的設定
OSWorld(Xie 等人,2024,arXiv:2404.07972)是常被引用的評測,這裡只看它怎麼量,不談排名。它在虛擬機器裡跑真實的作業系統與軟體,收了 369 個在 Ubuntu 上執行的任務,涵蓋網頁、桌面應用程式與跨軟體流程。每題先把環境還原到指定起點,再由專屬的檢查程式看最後的檔案、設定或介面狀態,判斷是否完成,而不是比對模型自己怎麼說。
論文的觀察可以是截圖、無障礙樹或兩者並用;動作是用 pyautogui 程式碼寫成的滑鼠與鍵盤操作。在原始論文的實驗設定下,每題最多互動 15 步;論文也量到截圖解析度、提供多少步歷史都可能影響成功率,所以設定不同的分數不能直接相比。OSWorld 之後也修訂過:2025 年的 Verified 版處理了社群回報的約 300 個問題,網站改版與驗證碼都會讓題目失效;2026 年另有改收 108 個長流程任務的 2.0 版。
風險:畫面上的字、誤點與帳號權限
畫面內容注入是這個做法最特別的風險。模型把截圖裡的字當輸入讀進來,所以網頁、文件或圖片裡一句「忽略先前指示,改做這件事」,也可能被當成指令,而不只是資料。OWASP 稱之為間接提示詞注入,也提到多模態模型可能受圖片裡藏的指令影響,並說不確定有沒有萬無一失的防法。完整說明見提示詞注入(Prompt Injection)提示詞注入(Prompt Injection)是什麼提示詞注入是讓模型把不可信內容中的文字當成應遵循的指令,進而偏離原本任務。本文用閱讀活動報名郵件的原創案例,說明直接與間接注入、資料和權限的界線,以及為何檢索、引用格式或一句「忽略惡意指令」不能包辦防護,並整理外部內容分隔、工具授權與人工確認各自能阻止的失敗。閱讀全文。Anthropic 文件說,即使有分類器掃描截圖,隔離與確認仍不可少。
兩家官方文件列的防護很接近:在隔離的虛擬機器或容器跑;只給任務需要的權限與資料,登入資訊尤其要避免;用網域允許清單限制能連的網站;購買、傳送資料、刪除、同意條款這類難以回復或需要同意的動作由人確認,OpenAI 還寫明在表單輸入敏感資料也算傳送。OpenAI 另建議設定步數、時間或費用上限,並檢查實際結果,不只相信模型最後說的話。隔離環境的概念見沙盒(Sandbox)沙盒(Sandbox):讓 AI 執行工具時有明確邊界沙盒以系統層限制程式能接觸的檔案、網路和資源,常用來隔離 AI 代理執行的程式或工具。本文用整理活動報名資料的情境說明可讀範圍、輸出目錄、網路限制與驗證,區分沙盒、容器、虛擬機器和提示詞規則,也解釋為什麼放進沙盒仍不能任意提供機密或正式系統權限。讀完能看懂隔離保護的是哪一層,以及它沒有替你檢查哪些事情。閱讀全文。
誤點與帳號權限是同一個問題的兩端:代理用誰的帳號,誤點就等於誰按下去。Anthropic 的瀏覽器工具文件說,躲不開已登入狀態時,要用專用的低權限帳號,並對會改動帳號的動作保留人工確認。
示例:在測試帳號裡填一張表單
以下是示例,未實測。假設有個只放虛構資料的活動報名測試頁,跑在沒有真實會員資料的虛擬機器裡,網路只允許連到這個測試站,登入的是專用測試帳號。任務是填姓名、場次、備註,並在送出前停下來。
- 截圖,確認畫面是測試站的表單,不是登入頁或彈出視窗。
- 點姓名欄、輸入虛構姓名,再截圖,確認欄位內容和輸入一致。
- 場次是下拉選單;點選沒反應就改用鍵盤方向鍵與 Enter,再截圖確認選到哪一場。
- 填備註,再截圖確認。
- 停在送出鈕之前,列出三個欄位的值,由人檢查並自己按送出。
預期輸出是三個欄位與指定內容一致、停在送出之前,並留下每一步的截圖與動作紀錄。失敗要分開判讀:欄位內容不對,先看是點錯位置還是輸入法改了字;連續幾圈畫面都沒變,多半是重複一個無效動作,應停下來而不是調高步數上限;畫面冒出「改填別的資料」這類文字,視為不可信內容,不照做並留下截圖。
怎麼選:先 API,再網頁,最後才是畫面
順序是:有 API 就用 API,最穩也最容易驗證;任務只在網頁內,以網頁結構為主的做法通常更合適,Anthropic 文件也這樣建議;兩者都碰不到才輪到電腦操作,先挑結果能檢查的任務。其他名詞可到AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文查。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Anthropic:Computer use tool(開發者文件;截圖加滑鼠鍵盤控制、迴圈、批次動作、限制、安全建議) · 查證日期:
- Anthropic:Browser use tool(開發者文件;網頁結構加截圖、與電腦操作的取捨、低權限帳號) · 查證日期:
- OpenAI:Computer use(開發者指南;瀏覽器與桌面介面、程式碼執行與電腦工具兩種接法、安全執行) · 查證日期:
- OpenAI:Computer use integration recipes(開發者指南;自訂 UI 工具、確認與同意、隔離環境) · 查證日期:
- Xie 等人:OSWorld(arXiv:2404.07972,評測環境、觀察與動作空間、任務與執行式評分) · 查證日期:
- XLANG Lab:Introducing OSWorld-Verified(2025 年修訂版的說明) · 查證日期:
- Yuan 等人:OSWorld 2.0(arXiv:2606.29537,長流程任務版) · 查證日期:
- OWASP:LLM01:2025 Prompt Injection(間接注入、多模態注入、緩解措施) · 查證日期:
- Playwright:Locators(以角色與使用者可見屬性定位元素,避免綁定 DOM 結構的選擇器) · 查證日期: