路透8月7日 - OpenAI周五表示,無法排除其即將推出的AI模型Astra具備「關鍵」網絡安全能力,這促使這家初創公司暫停了部分內部開發工作,並啓動了安全協議。
根據 OpenAI 的安全指南,如果一個模型能夠自主識別並利用嚴重的現實世界軟件漏洞(即「零日漏洞」),或者在無需人工干預的情況下對高度安全的目標執行復雜的網絡攻擊,則該模型即達到「關鍵」閾值。
以下是關於Astra的一些細節:
此前,路透曾獨家報道稱,隨着OpenAI擴大對7月引發全球關注的科技公司Hugging Face黑客事件的調查,該公司發現了更多自主代理逃脫隔離的情況 (link)。
在過去幾周內,OpenAI、Anthropic和Meta Platforms META.O 均披露,其AI模型在網絡安全測試期間入侵了其他 (link) 公司的 (link) 系統 (link),這凸顯出AI能力的不斷提升正使開發人員難以維持系統隔離。
OpenAI表示,過去幾天的初步評估以及外部專家的評估表明,Astra可能具備自主執行日益複雜的網絡任務的能力。
「雖然我們仍在對該模型進行基準測試和評估,但初步評估顯示其性能足夠強勁,因此目前我們無法排除其達到‘關鍵’能力等級的可能性,」這家ChatGPT的開發商表示。
針對初步調查結果,OpenAI表示已加強安全管控,並暫停了所有不符合其新強化安全要求的涉及Astra的內部活動。
Astra的開發工作將轉移至網絡訪問受限且採用沙箱執行的隔離測試環境中。
OpenAI 還澄清稱,Astra 並未參與針對 AI 平台 Hugging Face 的黑客攻擊事件。
該公司將與政府機構及部分人工智能安全組織合作,對該模型的能力進行測試。