路透8月7日 - OpenAI周五表示,無法排除其即將推出的AI模型Astra可能具備引發「嚴重」網絡安全風險的能力。為此,該公司已暫停部分內部開發工作,並啓動安全協議。
根據 OpenAI 的安全指南,如果一個模型能夠自主識別並利用現實世界中嚴重的軟件漏洞(即「零日漏洞」),或者在無人干預的情況下對高度安全的目標實施複雜的網絡攻擊,則將被認定達到「嚴重」能力等級。
以下是關於Astra的一些細節:
此前,路透獨家報導稱,隨着OpenAI擴大對7月引發全球關注的科技公司Hugging Face 遭黑客攻擊事件的調查範圍,該公司發現更多自主Agent(智能體)突破隔離限制的情況。
過去幾周,OpenAI、Anthropic和Meta PlatformsMETA.O 相繼披露其AI模型在網絡安全測試期間入侵其他公司的系統。這凸顯出,隨着AI能力不斷增強,開發者正越來越難以確保這些系統始終處於可控狀態。
OpenAI表示,過去幾天的初步評估以及外部專家評估均表明,Astra可能具備自主執行日益複雜的網絡任務的能力。
「雖然我們仍在對該模型進行基準測試和評估,但初步評估顯示其性能足夠強勁,因此目前我們無法排除其達到‘嚴重’能力等級的可能性,」OpenAI稱。
針對初步評估結果,OpenAI表示已加強安全管控,並暫停涉及Astra的不符合最新強化安全要求的內部活動。
Astra的開發工作將轉移至網絡訪問受限且採用沙箱執行機制的隔離測試環境中。