OpenAI即將推出其最新旗艦模型,標誌着AI能力與商業化部署進入新階段。
OpenAI首席執行官Sam Altman周二在社交媒體上宣佈,GPT-5.6 Sol將於本周四正式發布。這是GPT-5.6系列中的旗艦模型,搭載全新ultra多智能體模式與max推理強度,在編碼、生物學和網絡安全等核心基準測試中均刷新最佳紀錄。

在定價方面,Sol定價為每百萬Token輸入5美元、輸出30美元,位居GPT-5.6系列三款產品的最高端。OpenAI同時宣佈,將於7月在Cerebras硬件上推出Sol,推理速度最高可達每秒750個Token。
此次發布採用分階段策略,初期僅向部分可信合作伙伴開放API和Codex訪問權限,OpenAI計劃在未來數周內向更廣泛用戶普及GPT-5.6全系列。
旗艦性能:Sol Ultra以91.9%領跑行業
在編碼基準Terminal-Bench 2.1上,GPT-5.6 Sol Ultra以91.9%的得分位居第一,GPT-5.6 Sol以88.8%緊隨其後,競品Claude Mythos 5以88.0%排名第三,差距約為0.8個百分點。Gemini 3.1 Pro Preview以70.7%墊底,與第一梯隊差距明顯。

從梯隊分佈來看,GPT-5.6 Sol Ultra與Sol構成第一梯隊;Claude Mythos 5、GPT-5.6 Terra和Claude Fable 5均在84%以上,形成第二梯隊;GPT-5.5和GPT-5.6 Luna屬於第三梯隊。
在成本效率維度,GPT-5.6 Sol在相同API成本下持續取得最高得分,性價比居系列之首。GPT-5.5和GPT-5.6 Luna則呈現明顯的"成本瓶頸"——增加投入帶來的性能提升十分有限。

在推理能力方面,隨着輸出Token數量增加,GPT-5.6 Sol的得分提升斜率最陡,說明其能最有效地利用複雜推理過程改善輸出質量;Luna曲線則相對平緩,即使增加輸出量,質量提升也十分有限。

全新模式:Ultra多智能體架構超越單一模型上限
GPT-5.6引入兩項關鍵技術升級。其一是max推理強度,賦予Sol充足時間進行深度推理;其二是ultra模式,通過調用子智能體協同工作,突破單一智能體的能力邊界,專為加速複雜任務設計。
在生物學領域,Sol在評估長周期基因組學和定量生物學分析的GeneBench v1基準上,以更少Token取得了優於GPT-5.5的結果,顯示出更高的計算效率。
在網絡安全領域,Sol在ExploitBench基準上僅使用約三分之一的輸出Token,即可與Claude Mythos Preview競爭。在由UC Berkeley研究人員與OpenAI及其他前沿實驗室合作創建的ExploitGym基準上,GPT-5.6 Sol、Terra和Luna三款模型均隨推理強度提升展現出網絡安全能力的顯著增長。
OpenAI表示,Sol更擅長幫助用戶發現並修復漏洞,而非可靠地執行端到端攻擊,並強調其優先目標是確保這些能力惠及防禦者。
三級產品矩陣:價格覆蓋不同需求層次
GPT-5.6系列採用全新命名體系,以數字標識代際,Sol、Terra、Luna代表三個可獨立演進的能力層級,旨在為用戶和開發者提供更清晰的智能、速度與成本選擇。
定價方面,Sol為輸入5美元/百萬Token、輸出30美元;Terra為輸入2.50美元、輸出15美元,約為Sol的一半;Luna為輸入1美元、輸出6美元,是系列中成本最低的選項。OpenAI指出,Terra的性能可與GPT-5.5競爭,成本僅為後者的一半;Luna則以最低成本提供基礎能力。
在緩存機制上,GPT-5.6引入更可預測的提示緩存,支持顯式緩存斷點和30分鐘最低緩存生命周期。緩存寫入按未緩存輸入費率的1.25倍計費,緩存讀取享受90%折扣。
此外,OpenAI計劃7月在Cerebras上推出GPT-5.6 Sol,推理速度最高達每秒750個Token,初期訪問權限將限於部分客戶,隨容量擴展逐步放開。
安全機制:分層防護棧配合700萬GPU小時紅隊測試
鑑於Sol在網絡安全領域的強大能力,OpenAI為GPT-5.6系列配備了其迄今最穩健的安全防護體系,並採用分階段發布策略。
防護體系採用多層架構,包括訓練層面的模型級拒絕機制、生成過程中的實時網絡安全與生物學濫用分類器、賬號級行為審查,以及差異化訪問控制。對於高風險請求,系統可在生成過程中暫停輸出,由更大的推理模型審查上下文,並在內容到達用戶前予以攔截。
在壓力測試方面,OpenAI投入超過70萬個A100等效GPU小時用於自動化紅隊測試,專注於發現可跨多種提示和上下文生效的通用越獄攻擊,並輔以第三方人類專家紅隊測試。
根據OpenAI的準備框架,GPT-5.6 Sol未跨越網絡安全"危急"閾值。在涉及Chromium和Firefox的評估中,Sol識別出了漏洞和利用原語,但在測試條件下未能自主生成可用的完整攻擊鏈漏洞利用。
OpenAI表示,此次先行向可信合作伙伴開放的有限預覽,是與美國政府持續溝通的一部分,但同時明確表示"不認為這種政府訪問流程應成為長期默認做法",並將與政府合作制定面向未來模型發布的可重複流程。