路透5月7日 - OpenAI 周四為其開發者平台推出了三款音頻模型,旨在讓基於語音的軟件代理更具對話性,並能夠實時完成任務。
應用程序編程接口 $(API)$ 的發布,標誌着這家ChatGPT開發商的業務範圍已從文字轉錄和聊天功能,擴展至能夠實時聆聽、翻譯並在對話中採取行動的智能代理。
這三款新模型分別為GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper。OpenAI表示,用戶可在其開發者實驗平台中進行測試。
GPT-Realtime-2 旨在處理更復雜的請求、調用工具、應對對話中斷,並在較長的語音會話中保持上下文連貫性。
第二款模型支持將70多種語言翻譯成13種目標語言,主要面向客戶支持、教育及其他場景。
GPT-Realtime-Whisper提供實時語音轉文字功能,可在發言者講話時生成字幕、會議記錄和工作流程更新。
正在測試這些模型的客戶包括在線房地產交易平台 Zillow ZG.O、在線旅行社 Priceline 以及歐洲電信公司德國電信 DTEGn.DE。
GPT-Realtime-2的定價為每百萬音頻輸入令牌32美元起,GPT-Realtime-Translate每分鐘0.034美元,GPT-Realtime-Whisper每分鐘0.017美元。
(為便利非英文母語者,路透將其報導自動化翻譯為數種其他語言。由於自動化翻譯可能有誤,或未能包含所需語境,路透不保證自動化翻譯文本的準確性,僅是為了便利讀者而提供自動化翻譯。對於因為使用自動化翻譯功能而造成的任何損害或損失,路透不承擔任何責任。)