豆包正從聊天與內容助手轉向桌面執行型 Agent:Windows 虛擬桌面可查看螢幕、移動滑鼠、點擊按鈕與輸入文字,使用者也能暫停或接管操作。 它的特色不只在於「會點擊」,而是將桌面自動化、Skills、連接器與字節跳動的創意工具(包括 Seedance 2.5)整合在同一個助手中。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did ByteDance’s Doubao PC client, as described in the August 21, 2026 post, evolve into a Codex-style AI agent and a Chinese “ChatGPT-pl. Article summary: Doubao’s shift is best understood as a move from a chat-and-content assistant to a desktop execution agent: it can reason about a task, access tools and connected services, and—in the Windows virtual-desktop mode—visuall. Topic tags: general, general web, documentation, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
豆包的 PC 用戶端如今已不宜只被視為聊天機器人。更準確的說法是:它正在成為一款桌面 AI Agent——能理解目標、選擇工具,並在瀏覽器、第三方服務與電腦介面之間執行多個步驟。
因此,把它形容為中國版「ChatGPT+Codex」並非毫無根據。不過,這仍是產品定位上的類比,並不代表豆包已被證明是中國市場上最好的 Codex 替代品。目前證據較能支持的是:豆包的執行能力明顯擴張;至於可靠性、安全性、整合範圍與開發者工作流程,仍缺乏充分的比較數據。
最清楚的證據來自豆包 Windows 版的工作任務模式與虛擬桌面。完成授權後,Agent 可以查看電腦畫面、移動滑鼠、點擊按鈕,並透過鍵盤輸入文字;使用者可以觀察進度、暫停任務,或在需要時接手操作。1
這改變了傳統聊天機器人的互動模式。一般聊天機器人可能會解釋任務步驟、撰寫內容或提供操作建議;電腦操作型 Agent 則會嘗試進一步進入應用程式本身,開啟軟體、填寫資料、在工具之間搬移資訊,最後產出結果。
相關報導也將豆包 PC 用戶端描述為一套結合已登入瀏覽器、GUI 電腦操作、手機遙控電腦、可選擇的雲端電腦、第三方連接器與可重複使用 Skills 的架構。2
7 這正是把 ChatGPT 式對話能力與 Codex 式任務執行能力放在同一個產品中的方向。
這個類比可以拆成兩個層次:
所以,豆包的產品邏輯不只是「一個會點擊滑鼠的 AI」。它更像是一個能替工具、工作流程與專門能力提供入口的協作層。字節跳動的文件提到 Web Search 聯網內容插件、Agent Skills 與 MCP,顯示其方向是工具導向的系統,而不只是一個對話視窗。17
這個區分很重要:GUI 自動化只是其中一層。連接器與結構化工具呼叫通常能提供更穩定、較容易稽核的服務存取方式;當沒有合適整合時,GUI 控制才發揮價值。
Skill 可以理解為一套封裝好的工作流程:將完成某類任務所需的步驟整理成可重複使用的能力。實務上,最值得建立成 Skill 的流程通常具備以下特徵:
這比起一開始就把龐大、模糊的目標一次交給 Agent,更為實際。較好的做法是先從小型流程開始,檢查結果、找出失敗環節,再考慮重複使用或排程執行。
有關豆包工作的報導提到辦公內容製作、研究、定時分析與團隊共享流程,也包括將文件、試算表、簡報與網頁結果送回飛書,讓團隊繼續審閱。由於這些整合與功能可用性的資訊來自使用者產出的社群媒體內容,應視為可信度較低的產品報導,而不是已獨立驗證的普遍能力。32
但背後的原則相當穩健:AI 真正變得有用,往往不是因為它能處理任何模糊指令,而是因為人們先找出重複、規則明確的工作,再把驗證過的步驟轉成受監督、可重複使用的流程。
比較京東商品、建立騰訊問卷、安排順豐寄件、填寫發票、比較 API 價格、分析 YouTube 標題,以及執行定時工作流程等例子,都呈現同一種模式:
說明想要的結果,讓 Agent 執行例行步驟,再由人類檢查成果。
不過,現有資料並沒有獨立驗證上述每一項示範都能以普遍、穩定的方式使用。產品展示可能取決於特定帳戶狀態、網站版面、授權設定,或某些仍需人工完成的步驟。
目前較有證據支持的說法應該更精確:豆包虛擬桌面展示了在使用者授權與監督下,Agent 操作本機 Windows 環境的電腦使用自動化能力。1
這是一項重要進展,但不等於已證明豆包能可靠地處理所有網站、付款流程、企業系統或例外情況。
豆包的 Agent 策略並不局限於辦公軟體。Seedance 2.5 發布時,主打長篇敘事、多模態參考素材與編輯能力的提升,並陸續在豆包專業版等平台提供使用。18
該模型支援原生生成單段 30 秒影片;豆包的創意影片 Skill 則可透過 Agent 流程拆解較複雜的需求,協調圖片與影片生成。26 這讓豆包呈現出另一種產品形態:同一個助手可能從自然語言需求出發,完成創意規劃、整理參考素材,再推進到影片製作流程。
當然,這並不能證明產出的影片在所有專業場景都更優秀。但它展示了 Skills 的作用:在使用者的廣泛目標與多個專門模型或工具之間,加入一層能夠拆解任務、協調工具的 Agent。
使用桌面 Agent 時,建議選擇能完成任務、同時最不脆弱的自動化方式:
不應讓 Agent 在高風險服務上無人監督地運作,例如金融平台、支付系統、可公開發布內容的帳戶、含有敏感個人資料的入口網站,以及小紅書等一旦誤發內容或誤操作帳戶,可能造成重大損失的平台。
實際原則很簡單:可以讓 Agent 準備資料與導覽操作,但凡是難以撤銷的事情,都應由人類最後確認。
豆包的用戶規模,有助於解釋字節跳動為何要把產品從對話推向工作執行。有報導稱豆包擁有3.82 億月活躍用戶,北京市政府發布的報告也引用了超過 3.82 億月活躍用戶的數字。2
9
作為比較,路透社引述 Sensor Tower 數據報導,ChatGPT 在 2026 年 5 月達到估計全球 10 億月活躍 App 用戶。33 但兩者並非完全可比:涵蓋地區、統計方式與產品範圍都不同。這些數字本身也不能證明模型品質、企業導入準備度或 Agent 可靠性。
因此,豆包的機會未必是用單一全球用戶指標追上 ChatGPT,而是把龐大的中國市場用戶基礎,轉化為對本地工作工具、服務與創意流程的日常使用。
目前最有根據的結論是:豆包已成為一個具吸引力、面向中國市場的 Codex 式替代方案。支持這項判斷的因素包括:
但現有證據尚不足以證明豆包在中國市場上必然是 Codex 的最佳替代品。要支持這項更強的結論,仍需要受控比較,包括任務完成率、失敗復原能力、安全控制、整合覆蓋範圍、價格、開發者工具與生產環境可靠性。
現階段,豆包最重要的轉變是產品觀念上的:它試圖讓 AI 不只負責產生答案,也能真正推動工作向前進行。這個市場最後的勝負,將取決於產品能否在廣泛能力之外,提供可靠的整合、透明的權限,以及有紀律的人類監督。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
豆包正從聊天與內容助手轉向桌面執行型 Agent:Windows 虛擬桌面可查看螢幕、移動滑鼠、點擊按鈕與輸入文字,使用者也能暫停或接管操作。
豆包正從聊天與內容助手轉向桌面執行型 Agent:Windows 虛擬桌面可查看螢幕、移動滑鼠、點擊按鈕與輸入文字,使用者也能暫停或接管操作。 它的特色不只在於「會點擊」,而是將桌面自動化、Skills、連接器與字節跳動的創意工具(包括 Seedance 2.5)整合在同一個助手中。
使用 GUI 操作時應採取人機協作:優先使用官方連接器或核准的 API,並讓人類確認登入、付款、公開發布與其他不可逆操作。