OpenAI 正押注讓 ChatGPT 像人類一樣操作電腦,將聊天機器人打造成數位工作的預設介面。
OpenAI 正押注讓 ChatGPT 像人類一樣操作電腦,將聊天機器人打造成數位工作的預設介面。

OpenAI 正將 Computer Use 工具整合至 ChatGPT,讓 AI 助理能夠點擊、輸入文字,並在應用程式和瀏覽器中操作導航——此舉直接挑戰 Anthropic,後者的 Claude Cowork 已吸引 60 萬家組織採用。
「一旦 ChatGPT 能比你我都更快地使用電腦和軟體,它將改變你預設與電腦互動的方式,」OpenAI Computer Use 團隊經理 Ari Weinstein 表示。
該公司今年推出了一款 Chrome 擴充功能,讓 ChatGPT 能接管瀏覽器,同時為 AI 助理建立了雲端和應用程式內瀏覽器,使其能與公開網站互動,並將 Computer Use 加入其 Codex 編碼工具。OpenAI 總裁 Greg Brockman 在 X 平台上發文表示,4 月的一次更新使這項技術「不再僅限於程式設計師,而是適用於所有從事電腦工作的人」。
此番擴張瞄準的是一個 Anthropic 率先佈局的市場——該公司於 2024 年推出 Computer Use——且企業採用正在加速。OpenAI 的舉措可能重塑企業分配軟體預算的方式,並加劇微軟、谷歌與亞馬遜投資的 Anthropic 之間的競爭。
OpenAI 如何訓練 Computer Use
OpenAI 最新模型的每個訓練階段都包含了有助於提升 Computer Use 能力的數據或流程。哥倫比亞大學 AI 研究員、曾參與開發電腦操作智慧體熱門基準測試的周宇表示,這類額外訓練建立在標準 AI 模型的既有能力之上,教會它如何處理更多任務。
周宇指出,在最早期的階段——OpenAI 以大量數據建立模型基礎時——公司可能納入了逐幀截圖,以「前置加載」對 Computer Use 有用的資訊。在後續步驟中,開發人員可向模型提供顯示理想輸入數據(可產生特定輸出)的資料——在此案例中,即導致該結果的電腦功能,例如填寫稅表或建立 3D 模型。
這些數據可來自人類訓練員:OpenAI 在宣布 2025 年版 Computer Use 時表示,已使用了人類示範如何完成任務的數據集。周宇表示,這類數據成本高昂,因為難以取得且需要清理才能使用。OpenAI 也可能透過指示模型嘗試完成虛擬任務並獎勵成功行為(即強化學習)來提升模型的電腦操作技能。
瀏覽器成為新的戰場
Weinstein 表示,OpenAI 已升級其模型在操作電腦和處理數據時的方式。過去,ChatGPT 會對用戶的電腦進行螢幕截圖、分析像素、注入指令,然後重複此流程。如今,當工具開啟網站時,它可以快速讀取頁面的底層結構——記憶體結構、無障礙資訊和連結關係。
該工具仍會進行螢幕截圖:用戶在設定 Computer Use 時會被要求允許 ChatGPT 錄製其螢幕,以便快速分析螢幕上的內容。Weinstein 表示,這些工具的組合為 OpenAI 的 Codex 提供了一種方式,可在「完整迴圈」中測試其建構的程式碼、找出錯誤並進行改進。
這就是捷克共和國業餘程式設計師 Cristian Medina Ruiz 的應用案例。他使用 Codex 從原始程式碼重建了 2013 年的城市建造遊戲《模擬城市》。Computer Use 工具在他的電腦上開啟了一個視窗,以驗證遊戲是否正確模擬了汽車移動和建築圖像。Ruiz 表示,Computer Use 讓他完全投身於 ChatGPT,他現在即使不在電腦前,也會讓程式碼持續運行並不斷迭代。
Weinstein 和負責 OpenAI 瀏覽器功能的 James Sun 表示,這項技術的部分前景在於將 ChatGPT 的智慧體與網路上不同部分及其「長尾」網站連接起來。大多數線上工具都是專為人類操作而建——預約掛號網站、公司的內部庫存儀表板、社群媒體平台。Weinstein 和 Sun 表示,他們看到 Computer Use 的用戶正在自動化資料輸入工作、合規任務和行事曆排程。
周宇表示,目前技術的速度與消費者期望的水準之間存在「差距」。「我們確實看到,當我們提供大量訓練數據時,電腦操作智慧體在特定領域能表現良好,」周宇說。「但當你想要推廣到任何網頁、任何應用程式、任何作業系統時,這仍然非常困難。」
當 OpenAI 執行長 Sam Altman 在 2025 年討論早期 Computer Use 版本時,他在 X 平台上寫道:「雖然其實用性顯著,但潛在風險同樣巨大」,並補充:「我們建議給予智慧體完成任務所需的最低存取權限,以降低隱私和資安風險。」
OpenAI 將這項責任置於用戶身上,讓資安公司 Malwarebytes 總經理 Mark Beare 感到擔憂。「這對我來說仍然感覺有點像是狂野西部,」Beare 表示,並補充說客戶可能沒有設置足夠的隱私保護,企業也難以跟上 AI 治理的步伐。
Sun 表示,他的團隊一直在處理他所謂的「確認政策」問題,即 Computer Use 工具應在何時以及多久要求用戶允許其下一步操作。到目前為止,他們已決定每當 AI 智慧體傳輸數據或刪除內容時,都應先詢問用戶。「你可以讓某樣東西 100% 安全,但那樣會非常難以使用;你也可以讓某樣東西非常易用但極其危險,」Sun 說。
對投資者而言,利害關係十分明確。OpenAI 將 Computer Use 擴展至 ChatGPT,使其有機會在 Anthropic 自 2024 年以來持續構建的企業自動化市場中分一杯羹。投資 OpenAI 並將其模型嵌入 Azure 和 Office 的微軟,將從更廣泛的智慧體採用中受益,而谷歌的 Gemini 和亞馬遜對 Anthropic 的投資則創造了競爭平台。這場讓 AI 智慧體具備操作電腦能力的競賽,將決定哪個平台成為數位工作的預設介面——以及哪些公司能獲得隨之而來的訂閱和用量營收。
本文僅供資訊參考,不構成投資建議。