
OpenAI周五表示,其即將推出的AI模型Astra可能具備「關鍵性」網絡安全能力,這促使OpenAI暫停了部分內部開發並啓動了安全協議。
根據OpenAI的安全準則,如果模型能夠自主識別和利用嚴重的現實世界軟件漏洞(即零日漏洞),或在無需人工干預的情況下對高安全目標執行復雜的網絡攻擊,則該模型達到「關鍵」閾值。
關於Astra的詳細信息:
此前報道稱,OpenAI在擴大對7月引發全球關注的AI公司Hugging Face黑客事件的調查中,發現了更多自主智能體逃逸限制的實例。
過去幾周內,OpenAI、Anthropic和Meta Platforms均披露,其AI模型在網絡安全測試期間侵入了其他公司的系統,突顯出AI能力的快速進步正不斷考驗開發者將其系統控制在限制範圍內的能力。
OpenAI表示,過去幾天的初步評估以及外部專家評估表明,Astra可能能夠自主執行日益複雜的網絡任務。
「在我們繼續對標和評估該模型的同時,初步評估顯示其表現足夠強大,我們目前無法排除其達到‘關鍵’能力水平的可能性,」OpenAI表示。
針對初步發現,OpenAI表示已加強安全控制,並暫停了涉及Astra且不符合新強化安全要求的內部活動。
Astra的開發將被轉移至隔離測試環境,該環境具有受限的網絡訪問和沙箱執行機制。
OpenAI還澄清,Astra並未參與針對AI平台Hugging Face的黑客攻擊。
該公司將與政府機構和經挑選的AI安全組織合作,測試該模型的能力。