押注語音即AI入口!OpenAI發布新模型GPT-Live,ChatGPT邁入實時對話時代

華爾街見聞
07/09

OpenAI正進一步押注語音交互。

美東時間8日周三,OpenAI發布全新的語音模型GPT-Live,同步升級ChatGPT語音模式(ChatGPT Voice)。新模型採用原生實時架構,可實現人類與AI之間更加自然的雙向語音交流,不僅支持打斷、停頓理解、實時翻譯、聽寫等能力,還能夠在後台無縫調用GPT-5.5等模型完成複雜推理和聯網搜索,將語音打造為ChatGPT新的統一交互入口。

OpenAI公告稱,GPT-Live包括GPT-Live-1GPT-Live-1 mini兩個版本,目前已開始向全球ChatGPT用戶陸續開放,覆蓋網頁、iOS和安卓平台,並計劃未來數周向API開放,開發者和企業用戶可提前登記獲取通知。

此次發布意味着,OpenAI正進一步押注語音將成為AI時代最重要的人機交互方式。OpenAI在發布新模型時透露,目前每周已有超過1.5億人使用ChatGPT Voice、Dictation等語音功能與ChatGPT交流。媒體評論認為,OpenAI希望未來用戶越來越少依賴鍵盤輸入,而更多直接與AI「說話」。

ChatGPT Voice 產品負責人 Atty Eleti說,此次發布語音模型「僅僅是個開始。我們認為,隨着時間的推移,這將使語音成為與計算設備交互的主要方式。」 它還可以用於「管理日益複雜、耗時較長且具有自主代理(agentic)性質的任務」。

付費用戶默認GPT-Live-1,免費用戶使用Live-1 mini

此次推出的GPT-Live並非單一模型,而是包括兩個版本:

  • GPT-Live-1:默認面向Go、Plus和Pro訂閱用戶;
  • GPT-Live-1 mini:面向免費用戶開放,作為默認語音模型。

OpenAI表示,兩款模型即日起開始全球逐步推送,覆蓋網頁版、iOS及Android客戶端。此前數月ChatGPT桌面版曾暫時回退部分新版語音能力,而此次發布暫未重新支持新版桌面語音體驗。

同時,OpenAI還計劃未來將GPT-Live接入API,方便開發者和企業將新的實時語音能力整合進自己的產品和應用。

GPT-Live-1兩版本測評性能明顯優於Advanced Voice Mode

相比此前ChatGPT採用的Advanced Voice Mode,GPT-Live最大的變化並不僅是響應速度。

OpenAI介紹,公司專門建立了一套新的人工評測體系,重點考察語音交流中的舒適度(pleasantness)和整體交流流暢性(flow of conversation)。

在持續5至10分鐘的一對一盲測中,無論是GPT-Live-1還是GPT-Live-1 mini,都明顯優於此前Advanced Voice Mode。

OpenAI表示,新模型在人類評測中,在以下多個維度均獲得更高偏好:

  • 整體交流體驗(Overall Preference)
  • 輪流說話自然程度(Turn-taking)
  • 打斷後的恢復能力(Interruptions)
  • 對話流暢性(Conversational Flow)
  • 是否更像人與人交流(Naturalness)

這也是OpenAI此次選擇全面替換原有語音模型的重要原因。

「輪流說話」升級為「實時交流",還能實時翻譯、聽寫、調整語速

GPT-Live最大的技術升級,在於採用原生全雙工(Full-duplex)語音架構。

過去,大多數AI語音助手仍遵循"你說一句、我答一句"的Turn-based模式,需要等待用戶說完整句話後才能開始識別和生成回覆,因此經常出現明顯停頓,也難以處理中途打斷。

GPT-Live則可以一邊聽、一邊理解,同時實時準備回答。

模型能夠識別用戶只是短暫停頓思考,還是已經結束髮言;當用戶插話時,它還能立即停止講話繼續傾聽,再自然接上對話,更接近人與人的真實交流方式。

與此同時,新模型還帶來了多項能力升級,比如具備實時雙向翻譯(Live Translation)能力,能更準確地語音聽寫(Dictation)、作出更自然的停頓、語調與情緒反饋,還能根據用戶要求放慢或加快說話速度,作出更自然的回應、語氣詞和傾聽反饋。

例如,假如用戶直接提出「能說慢一點嗎」的要求,模型即可實時調整自己的說話節奏,而不是簡單降低音頻播放速度。

不只是語音模型,而是ChatGPT所有能力的新入口

相比語音效果提升,更重要的是GPT-Live已成為連接整個ChatGPT能力體系的新入口。

OpenAI表示,語音模型負責自然交流,而真正執行復雜任務時,可自動調用後台不同模型。

例如:

  • 遇到複雜推理時,可自動切換GPT-5.5;
  • 需要聯網時,可直接調用Web Search;
  • 涉及天氣、股票、體育等實時信息,也能夠調用對應能力,再將結果自然地以語音形式返回。

因此,GPT-Live不再是一套獨立語音系統,而是ChatGPT所有AI能力的統一語音界面。

語音安全機制強化:高風險情況下可主動結束對話,家長可收到提醒

隨着AI越來越接近真人交流,OpenAI此次同步升級了語音安全機制。

OpenAI表示,當系統檢測到可能產生不安全內容時,可根據風險程度採取不同措施,包括:

  • 引導模型生成更加安全的回覆;
  • 主動展示額外安全提示;
  • 在風險較高情況下直接結束語音對話。

針對未成年人,OpenAI還將此前推出的家長控制功能擴展至ChatGPT Voice。

家長可以直接關閉青少年賬號的語音功能;如果已經允許使用,而系統檢測到青少年試圖將對話引向自殘等高風險內容,系統還會主動向家長髮送提醒。

OpenAI表示,這些安全策略旨在讓更加擬人的實時語音交互,在保持自然體驗的同時,也能夠滿足更高等級的安全要求。

已向全球ChatGPT用戶推送,但仍存在部分限制

OpenAI表示,GPT-Live已開始向全球ChatGPT用戶陸續開放。

目前,新模型支持Web、iOS和Android平台,並針對ChatGPT中最常用的多種語言進行了優化。不過OpenAI也坦言,部分語言目前仍可能存在非母語口音或流暢度不足的問題,公司正持續改進多語言表現。

與此同時,新版GPT-Live在首發階段尚不支持視頻和螢幕共享語音模式,相關功能仍在開發中。現階段,用戶如果需要在視頻或共享螢幕場景中使用語音交互,仍需使用此前的ChatGPT Voice(Legacy Voice)模式。

隨着未來API正式開放,GPT-Live也將成為OpenAI向開發者提供實時AI語音能力的核心基礎模型,進一步推動語音從聊天工具演變為AI時代的主要交互入口。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10