智通財經APP獲悉,5月20日,千問正式發布 Qwen3.7-Max ——面向智能體時代的新一代旗艦模型,即將通過API提供服務。Qwen3.7-Max致力於成為全能的智能體基座——無論是編寫和調試代碼、自動化辦公流程,還是在跨越數百乃至數千步的長周期任務中持續自主執行,都能勝任。
據悉,Qwen3.7-Max的核心優勢在於智能體能力的廣度與深度:編程方面,從前端原型開發到複雜的多文件工程均能駕馭;辦公與生產力方面,通過 MCP 集成和多智能體協作實現工作流自動化;長周期自主執行方面,在一項長達 35 小時、超過 1000 次工具調用的全自主內核優化實驗中保持了連貫推理,充分驗證了其持久穩定的執行能力;此外,無論部署在 Claude Code、OpenClaw、Qwen Code 還是其他框架下,都能穩定發揮出色的跨框架泛化能力。
Qwen3.7-Max — 即將通過阿里雲百鍊提供服務:
前沿編程智能體:從前端原型到複雜軟件工程
辦公生產力與工作流自動化,支持 MCP 集成和多智能體協作
持續穩定的長周期自主執行能力
跨多種智能體框架的泛化能力您可以通過 阿里雲百鍊 API 調用(即將上線)。
模型表現

在編程智能體方面,Qwen3.7-Max 在 SWE-Pro(60.6)、SWE-Multilingual(78.3)、SciCode(53.5)和 QwenSVG(1608)上均取得領先表現。在 Terminal Bench 2.0-Terminus(69.7)上超越 DS-V4-Pro Max(67.9)。在 SWE-Verified(80.4)上與 Opus-4.6 Max(80.8)和 DS-V4-Pro Max(80.6)表現相當。
在通用智能體方面,提升更為顯著。Qwen3.7-Max 在 MCP-Mark(60.8 vs. GLM-5.1 的 57.5)、MCP-Atlas(76.4 vs. Opus-4.6 的 75.8)和 Skillbench(59.2 vs. K2.6 的 56.2)上表現突出,並在 Kernel Bench L3(1.98 倍中位數加速,96% 加速率)上展示了強大的 GPU 內核優化能力。在 BFCL-V4(75.0)、Qwenclaw(64.3)和 ClawEval(65.2)上同樣表現出色,緊追 Opus-4.6 Max。在辦公自動化基準 SpreadSheetBench-v1 上得分 87.0,處於頂尖水平。
在推理方面,Qwen3.7-Max 在 GPQA Diamond(92.4 vs. Opus-4.6 的 91.3)、HLE(41.4 vs. Opus-4.6 的 40.0)、HMMT 2026 Feb(97.1 vs. Opus-4.6 的 96.2)、IMOAnswerBench(90.0 vs. DS-V4-Pro 的 89.8)和 Apex(44.5 vs. DS-V4-Pro 的 38.3)上均取得領先成績,在高難度推理基準上展現了強大實力。
在通用能力與多語言方面,Qwen3.7-Max 在 IFBench(79.1 vs. DS-V4-Pro 的 77.0)上表現突出,展示了精準的指令遵循能力。在 WMT24++(85.8)和 MAXIFE(89.2)上同樣領先,表明其多語言理解和翻譯質量處於一流水平。在 SuperGPQA(73.6)和 QwenWorldBench(57.3)上同樣表現出色。

值得強調的是,上述評測分數來自多種不同的智能體框架。Qwen3.7-Max 並非針對某一特定框架優化,而是在 Claude Code、OpenClaw、Qwen Code 和各類自定義工具使用框架下都能穩定發揮,是各類智能體系統的可靠底座。
生產力助手
面向真實生產力場景,Qwen3.7-Max 將成為您的深度協作者。依託強大的智能體能力,全面重塑專業工作流:海量信息的全面研讀與整合、複雜數據的深度分析與建模、出版級文檔與可視化生成——精準承接高複雜度、高強度的企業級任務。
Qwen3.7-Max 原生適配主流智能體框架。面向長鏈路交付任務,支持長達數小時的自主規劃與運行,通過上千次工具調用,數十輪版本迭代,持續提升交付物質量。以往需專業團隊耗時一至兩周的複雜項目,現由 Qwen3.7-Max 驅動的智能體即可在數小時內完成端到端交付閉環,推動生產力實現真實躍升。
智能體擴展
在 Qwen3.5 中引入的環境擴展方法基礎上,Qwen3.7 進一步大幅擴展了智能體訓練環境的質量與多樣性。正如語言模型從多樣化的預訓練文本中獲得泛化能力,我們發現智能體能力同樣可以從多樣化的訓練環境中實現泛化。
如下圖所示,這種環境擴展帶來了清晰且穩定的性能提升軌跡,Qwen3.7-Max 在綜合排名中位列前三,接近 Claude-4.6-Opus-Max 的水平。值得注意的是,我們評測中所有基準測試所涉及的環境均為訓練中從未出現過的全新領域外環境。
我們還觀察到擴展行為中一個顯著的可預測性:任意基準子集上的性能增益高度一致,可以可靠地預測其餘基準或整體平均值的相對增益,表明環境擴展驅動的是真正的能力泛化,而非針對特定基準的提升。關於擴展動態和方法論的進一步分析將在即將發布的技術報告中詳細介紹。

跨框架泛化能力
我們的 Rollout 環境基礎設施將每個訓練實例解耦為三個正交組件——任務(Task)、運行框架(Harness)與驗證器(Verifier),這些組件可自由重組。我們兼容多種運行框架及其迭代版本,並將環境立足於真實場景而非合成替代品。這種解耦設計實現了組合式擴展:同一任務能以極低的邊際成本,與不同類型、不同版本的框架及驗證器相匹配。更關鍵的是,它賦能了跨框架與跨驗證器的強化學習(RL)訓練——使模型在多變的框架配置下處理同源任務,從而迫使其學習具備泛化能力的解題策略,而非依賴特定框架的捷徑。在 QwenClawBench 與 CoWorkBench 評測中,無論評估時使用何種運行框架,Qwen3.7-Max 均展現出強勁且一致的性能,顯著超越 Qwen3.6 系列模型,證實了該模型已真正掌握了解決任務的能力,而非過擬合特定框架。

Qwen3.7-Max 可以無縫集成到主流智能體框架和編程助手中,包括Claude Code、OpenClaw、Qwen Code等。
更多港股重磅資訊,下載智通財經app
更多港股及海外理財資訊,請點擊www.zhitongcaijing.com(搜索「智通財經」);欲加入智通港股投資群,請加智通客服微信(ztcjkf)