辦公 Agent 爆火,模型大戰進入下一階段

AI速讀
近日,阿里、騰訊與字節跳動幾乎同步進行 AI Agent 產品線整合,標誌著模型大戰進入「入口與生態」競爭階段。阿里正式推出「千問辦公」,將此前分散的桌面、雲端與企業協作能力統一。分析認為,中國大廠的策略核心在於將 Agent 與 IM(如釘釘、飛書)及雲端基礎設施深度結合,以獲取個人 Agent 缺乏的「企業上下文」與執行權限。未來,競爭將聚焦於誰能建立「模型-Agent-真實任務」的反饋閉環,利用企業級數據驅動模型迭代,形成強大的競爭護城河。

模型大戰,終究是入口和生態大戰。



從今年 6 月到 8 月初,短短不到 60 天時間,有一件事幾乎同時在新 BAT 發生。

先是 6 月,阿里率先開啟內部 Agent 的產品線與能力大整合,到 8 月 3 日,官宣在程式設計(Coding)和專業辦公(Cowork)能力大幅提升的 Qwen3.8 模型的同時,正式將內部孵化的三款 Agent 產品 QoderWork、悟空、MuleRun 合併為統一的 Agent 產品「千問辦公」。

緊隨其後,7 月 20 日,騰訊開啟業務整合,QClaw 的相關業務和團隊被併入 WorkBuddy 體系。

10 天後的 7 月 30 日,字節跳動宣佈飛書產品團隊整體併入豆包,飛書負責人謝欣向豆包負責人趙祺匯報

不同的組織結構、不同的產品積累和優勢市場,三家中國最頂級的網際網路企業卻在相近時間作出相似整合選擇。這不太像巧合。

更合理的判斷是,這種整合,是在 AI 行業走過摸索期,進入入口爭奪階段背景下的必然選擇:過去,大廠需要用多個團隊驗證桌面操作、雲端執行和企業協作等不同路線;現在,主要產品形態已經逐漸清晰,競爭也開始從能不能做出 Agent,轉向誰能成為使用者和企業的統一入口。

而千問辦公作為這輪收束中最新落地的產品,也是最適合觀察觀察行業變化的樣本。

作為阿里階段性的能力重組,它將此前分散在模型、桌面端、雲端和企業協作場景中的積累,裝進了一款新的獨立產品。

同時,它身上也集中體現了企業 Agent 競爭中最關鍵的幾個問題:內部賽馬為什麼此時結束,企業 IM 與雲為什麼成為 Agent 的底層資產,以及模型、產品和真實任務如何形成共同進化的閉環。

讀懂它,就讀懂了企業級 Agent 真正的賽點。


01 大廠為什麼同時收斂路徑


大廠為什麼幾乎同一時間開始整合 Agent 產品?

拿阿里來說,在今年年初,同時保留 QoderWork、悟空和 MuleRun,是合理的。

三款產品代表了三種不同判斷。

QoderWork 運行在使用者電腦上,擅長讀取和處理本地檔案;悟空試圖進入釘釘的企業帳號、權限和應用體系;MuleRun 從一開始就運行在雲端,可以長時間執行任務,也更早進入海外市場,截至今年 5 月,它已經服務了 43 個國家和地區的企業和使用者,其中單月付費超過 200 美元的使用者佔比達到 34%。

在市場尚未定型時,三個團隊分別測試本地執行、企業協作和雲端運行,可以幫助阿里更快地找到方向。

問題在於,試錯期不會一直持續。今年上半年,行業對通用 Agent 的理解發生了明顯變化。

Anthropic 發現,許多非技術員工會繞過普通聊天介面,直接使用 Claude Code 整理檔案、處理表格和完成多步驟知識工作。於是,Cowork 在隨後被做了出來:它保留 Claude Code 的任務執行能力,但換成更適合普通知識工作者的互動方式。

相似的變化也發生在老對手 OpenAI 上。在 OpenAI,一部分使用者在 ChatGPT 裡處理程式設計問題,另一部分使用者則在 Codex 中完成報告、圖片和資料處理等非程式設計任務。聊天、程式設計和辦公之間原本清晰的產品邊界, 開始被使用者主動打破。於是,7 月下旬,OpenAI 將獨立運行近一年的 Codex 併入 ChatGPT 桌面客戶端內,至此 Chat、Work、Codex 三端合一。

而於千問辦公的此次動作來說,它同樣也是阿里三場實驗驗證過的能力重新組合:桌面端繼承本地檔案和電腦操作能力,雲端承接長任務、資源調度與多模態生成,企業端則繼續進入組織身份、權限和業務系統。把原來分散的產品能力和反饋資料,集中到一個入口、一套工程體系和一個迭代閉環中。

千問辦公實測,可以快速根據需求產出專業報告之外,還能直接打通釘釘傳送到聊天介面

使用者在自發的用腳投票,市場也已經沒有給大廠留下太多繼續分散試驗的時間。

易觀分析發佈的二季度報告顯示,2026 年 6 月,17 款主流桌面端 AI 辦公智能體的合計訪問量已經超過 6000 萬次。騰訊系、字節系和阿里系產品相加約為 5622 萬,留給其他玩家的市場不到 500 萬。

技術路線逐漸確定,頭部效應也開始出現,這時候,分散就會成為資源分配上的負擔。

工程層也是同理。過去,模型每升級一次,三支團隊都要針對務規劃、上下文管理、工具呼叫、失敗重試、權限控製做一次重新適配,這本質上是一種不必要的重複勞動

「千問辦公」就是在這個分秒必爭背景下出現的產物。


02 企業 Agent 的分水嶺


目前市場上大多數通用辦公 Agent,首先解決的仍然是個人生產力問題。它們可以讀取使用者電腦裡的檔案,分析個人文件,理解歷史對話,整理個人日程,再根據使用者本人擁有的權限呼叫有限的外部工具。

但這些主要是個人上下文。個人上下文的疊加不等於企業上下文。企業內所有人的效率相加,也不等於企業效率。給每位員工配置一個更聰明的個人助手,可以提高局部產出,卻未必能夠改善整體資訊流轉、任務協同,以及個人結果轉化為組織行動與結果的效率。

企業面對的是另一類問題。

企業並不是個個人帳號的簡單集合。所有員工的檔案、對話和任務相加,也不會自動變成企業的運行方式。同樣一份檔案,在個人 Agent 看來可能只是一份需要總結的材料;在企業 Agent 看來,它還涉及誰可以閱讀、誰需要確認、結論應該同步給那些部門,以及後續任務必須經過誰批准。

這是企業級 Agent 與個人辦公 Agent 最根本的區別。也是相似的整合背景下,中美大廠行為邏輯產生明顯區別的一個認知基礎。

OpenAI 和 Anthropic 主要在合併聊天、程式設計和桌面執行入口。中國大廠的整合範圍,則包括了釘釘、飛書這樣的企業協作軟體,同時也讓雲成為了 Agent 底層能力的一部分。

體現在企業內部產品協同上,豆包產品線融合飛書的同時,也與火山引擎深度結合。千問辦公合併了此前主攻釘釘場景的悟空,也同時繼承了阿里雲過去在企業級服務市場上關於行業認知、資料管理、資源調度的全方位資源。

也就是說,是 Agent 開始吸收 IM 與雲,把它們變成底層的 infra。

雲作為 Agent 核心 infra 的重要性不比多說。這裡我們主要看看 IM 的整合敘事。

傳統辦公軟體按照功能劃分世界:郵件負責溝通,文件負責寫作,表格負責資料……但真實世界中,使用者想完成一個目標,需要的是對中工具能力的組合,Agent 也是同理。

也是因此,過去十多年,整合了溝通、員工身份、組織關係、協作網路、檔案、會議、審批、權限和各種企業應用連接的釘釘式 IM,作為功能最多,也包含完整組織上下文的軟體,必定會成為 Agent 時代最底層的能力支撐。

我在自建的釘釘組織群裡模擬了一段三人選題討論,讓千問辦公總結討論要點並提取待辦事項。它不僅從對話中識別出了五條待辦,每條都正確分配了負責人,還給緊急的那條標了「較高」優先順序和「即將截止」,並直接寫入了釘釘的待辦系統。

當然,對一個外部的第三方 Agent 來說, 通過連接器讀取群消息,再生成一份摘要,或者完成投研、網頁製作或者表格處理並不困難。真正難的是寫回:建立待辦、調整日程、傳送郵件、提交審批,或者把任務分配給正確的人。

讀取只需要介面,而寫回需要更高的信任。企業必須確定 Agent 能看到什麼、可以替誰操作、那些步驟需要審批,以及發生錯誤後如何追溯和撤銷。從這一方面來看,過去十多年裡,釘釘為 Agent 的積累不僅是工具,更是信任與企業級上下文的護城河。


03 模型和 Agent,成為智能飛輪


如果再將眼光進一步收斂到國內的一梯隊玩家,不難發現,阿里在這場競爭中還有一項少見的條件。它同時擁有一線大模型、企業協作平台和雲端運算基礎設施。

但模型和應用都在自己手裡並不會自動轉化成優勢。只有模型和 Agent 能夠相互提供反饋時,這種組合才真正有價值。

於是,我們看到,推出千問辦公的同日,阿里低調放出在程式設計(Coding)和專業辦公(Cowork)方面能力大幅提升的 Qwen3.8。

這背後的邏輯在於,在生產環境中,Agent 可以為模型提供一種比聊天記錄更有價值的反饋,模型又能一勞永逸的解決 Agent 中的底層問題。

比如,很多 Agent 產品中很多看似發生在應用層的問題,根源其實在模型層。過去,模型選錯工具,產品團隊可以增加一條呼叫規則解決;模型在長任務中忘記最初要求,團隊也可以在外面再套一層工作流;這些應用上的修補客觀上可以降低錯誤率,卻不能改善模型本身的判斷與認知能力。

因此,我們可以看到 OpenAI 推出 Codex 時,沒有只是給通用模型接入程式碼編輯器,而是訓練了面向軟體工程任務的 codex-1。它使用真實程式設計任務進行強化學習,能夠讀取和修改檔案、運行測試,並根據測試結果繼續調整,直到得到通過的結果。它的出現,一舉改善了開發者們在程式設計任務中的大量問題,也成為 OpenAI 在程式設計領域逆襲的關鍵。

模型解決了 Agent 的底層能力問題,Agent 也可以為模型帶來比聊天記錄更完整的反饋

對 OpenAI 和千問系列模型來說,Agent 留下的完整行動軌跡,可以告訴模型它如何理解目標,制定了什麼計畫,呼叫了那些工具,在那一步偏離要求,使用者修改了什麼,以及最終產物是否真的被使用。尤其在程式碼任務中,在程式碼任務中,能不能運行、測試有沒有通過、檔案是否正確修改,通常可以被機器驗證。而這種真實企業任務中的失敗軌跡又能反饋給模型,成為模型迭代的動力。

最終,Agent 為模型提供真實任務反饋,模型為 Agent 提供更強的判斷能力。模型+ Agent 構成的,正是一套持續運行進化的飛輪系統。


04 結尾


當然,客觀來說,千問辦公這次整合完成,並不意味著阿里關於 Agent 的探索從此就可以高枕無憂了。但它至少說明,阿里已經找到了自己的主線。

當越來越多 Agent 都能製作 PPT、分析表格、控制瀏覽器時,各種 To C 式 Agent 的功能差異會快速縮小。未來真正的差距,將來自產品背後的系統能力:它掌握多少企業上下文,能夠獲得多大的執行權限,又能否把每一次 Agent 真實任務變成下一次模型升級的依據。

在這個過程中,IM 的上下文,infra 的基礎能力建設,模型與 Agent 的飛輪缺一不可。

千問辦公,已經拿到了半張門票。(極客公園)