辦公Agent的聚合路線「四國殺」正式打響

華爾街見聞
08/17

辦公Agent正式進入模型聚合大戰。

8月14日晚間,千問辦公宣佈上線智譜GLM-5.3和DeepSeek V4 Pro兩款模型,用戶可以在產品首頁的「前沿模型」檔位直接選擇使用。

就在同一天,百度文庫網盤通用智能體GenFlow正式啓用中文名「庫庫AI」,並推出獨立桌面端,其模型池同樣包含DeepSeek、智譜GLM等外部模型。

無獨有偶,騰訊WorkBuddy、字節TRAE Work都已經內置多家第三方大模型。

從騰訊、字節到阿里百度,國內頭部廠商的辦公Agent正在不約而同走向模型聚合模式。

過去大模型產品爭的是「誰家的模型更強」,到了辦公Agent階段,競爭邏輯開始出現變化:先把不同模型放進同一個工作台,讓更多用戶願意把真實工作交進來。

只有用戶真正用起來,寫作、表格分析、PPT製作等真實工作流持續進入Agent,平台纔有機會積累任務拆解、工具調用、失敗恢復和用戶糾正等反饋,並反過來打磨Harness,形成數據飛輪。

但下一道題也會隨之出現:同一項任務究竟該調用哪個模型。路由由此成為聚合路線需要繼續解決的問題。

踏入同一條河流

目前千問辦公對外展示的「前沿模型」數量並不算多,除了自家的千問模型,外部模型主要是GLM-5.3和DeepSeek V4 Pro。

但千問辦公明確表示三款前沿模型發布後都快速完成了接入,「這個節奏,我們會一直保持下去」。

這意味着,千問辦公的內置模型池後續還會繼續擴張。

相比之下,騰訊WorkBuddy已經形成了更大的內置模型池,不僅包括混元Hy3,還有智譜GLM、MiniMax、Kimi和DeepSeek等多個系列。

字節旗下TRAE Work也走在類似方向上。目前產品端可見的模型已經包括字節Seed系列、智譜GLM、DeepSeek以及千問等模型;

百度啱啱推出獨立端的庫庫AI,同樣引入了DeepSeek、智譜GLM等外部模型。

四家產品的共同點已經相當明顯:辦公Agent不再把自己的能力完全綁定在一家模型上。

原因在於,對辦公Agent來說,現階段比把每一次模型調用都留給自家模型更重要的是先讓用戶真正用起來。

當Agent開始搜索網頁、打開文檔、分析Excel、製作PPT、調用軟件,並與用戶來回修改一項工作時,都會留下更完整的執行過程:模型如何拆解任務、調用了哪些工具、哪一步失敗、用戶在哪一步進行了糾正,以及最終什麼結果被接受。

真實工作流正是Agent時代稀缺的數據資源。

百度集團副總裁、個人超級智能事業群總裁王穎認為,隨着公共數據逐漸被模型充分學習,AI繼續提升的過程中人產生的新知識、新經驗和新想法會越來越重要。未來真正需要共同建立的是通用智能體能力、記憶與存儲,以及個人知識和經驗三部分能力。

模型池越豐富,越有機會提升不同任務的完成率,降低用戶嘗試一款Agent的門檻;只有更多用戶真正把工作交給Agent,平台才能獲得持續反饋,再去優化任務拆解、Context管理、工具選擇、失敗恢復等Harness能力。

模型聚合由此不只是模型能力的拼盤,也是在為數據飛輪爭取更多真實任務。

但聚合併不意味着大廠之間的邊界已經消失。

從目前產品端可見的默認模型池來看,WorkBuddy雖然接入了多家外部模型,但其中沒有阿里的千問和字節Seed;TRAE Work已經內置千問模型,但沒有騰訊混元;庫庫AI目前也未見混元、千問和Seed。

各家雖然都在擴大模型選擇,但仍然保留着自己的生態邊界。

不可能三角

把更多模型裝進同一個Agent,只解決了「有沒有得選」的問題,真正決定聚合路線能不能跑通的是下一步怎麼選。

大模型落地一直存在一組近似「不可能三角」的權衡:效果、速度和成本很難同時拉滿。

能力更強的模型通常意味着更高的推理價格,複雜任務為了得到更好的結果也往往需要更長的思考和執行時間;反過來,一味追求便宜和低延遲,又可能犧牲任務完成質量。

路由要解決的本質上就是這道三角題:為了把一項工作做完,應該在什麼環節花更多錢換能力,又應該在什麼環節用速度和成本換效率。

這也讓聚合型辦公Agent的競爭開始出現另一層差異。

理想的狀態是用戶只需要提出任務,後台根據任務難度、時效要求和模型成本完成選擇。

到了這一步,用戶看到的可能只是一次「幫我做完這份報告」的請求,後台卻可能已經在不同步驟之間調用不同模型。

對於個人用戶,這種差別最終體現在結果好不好、需要等多久、消耗多少積分;對於企業客戶,則會進一步落到一項工作的單位算力成本。

辦公Agent一旦進入大規模使用,幾分錢、幾毛錢的單次調用差異,都會隨着任務量被不斷放大。

路由由此也成為成為一筆規模化的經濟賬。但從Agent的完整執行鏈條看,路由也是Harness中的一環。

一項任務從用戶提出,到最終交付,中間還涉及任務拆解、Context管理、工具調用、模型選擇和失敗恢復。路由決定「這一環該調用誰」,但真正決定任務能不能穩定完成的是整套Harness能否把這些環節協同起來。

這也是聚合路線真正可能形成壁壘的地方。模型本身可以接入,價格也可能隨市場競爭不斷下降,但如何在效果、速度和成本之間找到更好的平衡需要的是足夠多的真實任務,以及平台長期積累下來的調度經驗。

當WorkBuddy、TRAE Work、千問辦公、庫庫AI手裏的模型越來越多,真正拉開差距的可能是同一道題誰算得更精:什麼時候該用最強模型,什麼時候又根本沒必要。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10