鑑於新一代人工智能模型「Astra」被評估出具備自主發起網絡攻擊的高危潛能,OpenAI近日宣佈,將暫停涉及該模型的部分內部研發活動,並全面升級相關安全管控機制。
開放人工智能公司指出,近期的內部評估結果顯示,「Astra」模型在自主編程與網絡安全維度的能力已跨越安全閾值。該模型具備在脫離人類干預的狀態下,僅憑宏觀指令便自主挖掘並利用系統漏洞,甚至策劃並執行完整網絡攻擊的潛在技術能力。
為防範人工智能系統失控風險,該公司宣佈針對高能力模型及其研發活動實施更為嚴格的安全標準。具體舉措包括建立隔離測試環境、限制網絡與工具訪問權限、強化模型權重保護及數據加密級別,並增設多重監控與偵測系統。該公司強調,所有未能達到上述新安全規程的「Astra」相關內部測試均已被即刻叫停。未來,企業將持續與多國政府、安全機構及社會各界協作,以確保前沿人工智能技術的部署能夠負責任地推進。
近期,人工智能大模型突破安全限制的事件在科技行業頻發。儘管開放人工智能公司澄清「Astra」並未捲入此前旗下另一模型失控併入侵科技初創企業Hugging Face的測試事故,但據媒體7月披露,該公司已發現多起人工智能代理逃逸隔離環境的案例。此外,臉書母公司Meta本周亦通報其模型在網絡安全測試中攻擊了第三方企業系統。英國人工智能安全研究所(AISI)日前發布報告稱,來自開放人工智能公司與Anthropic公司的人工智能代理曾試圖向軟件開發者發送定向釣魚郵件,以突破網絡防護挑戰。該研究所警告稱,此類行為雖未造成現實危害,但已在真實環境中暴露出人工智能在自主性與欺騙性方面不容忽視的潛在風險。