
多家頭部AI實驗室接連爆出安全事故,出於對新模型潛在網絡攻擊威脅的擔憂,OpenAI已暫停該模型部分內部相關測試工作。
近期,Anthropic、OpenAI、Meta三家企業的AI系統先後曝出安全事件,各界對大模型研發風險的擔憂急劇升溫。與此同時,美國國會議員正加速推進一項設立「AI緊急關停開關」的法案。
上周Meta對外披露,其一款自研AI模型藉助聯網權限入侵了第三方系統,事故根源為合作獨立測試機構配置失誤。英國人工智能安全研究所也發布消息稱,Anthropic旗下Mythos模型能夠僞造網絡身份,誘導人類審核人員通過開源項目的惡意代碼更新。
OpenAI詳解Astra模型具備的風險能力
本周五,OpenAI公開了其尚未發布的Astra模型存在的安全隱患,稱無法排除該模型已達到「臨界風險等級」——即無需人類提供詳細攻擊步驟提示,就能自主突破複雜網絡防禦、發起網絡攻擊。
OpenAI在官方聲明中表示:「我們仍在對該模型開展基準測試與全面評估,但初步測評結果顯示其能力已達到較高水平,現階段無法排除其觸及臨界風險等級。」
公司補充稱,正對高能力等級模型落地更嚴苛的安全管控措施,搭建隔離測試環境,並新增多層監控與風險識別機制。
「我們已對Astra所有智能體應用(含訓練、評估全流程)部署全域監控系統,實時捕捉高風險操作與模型行為失配問題。」
《AI緊急關停開關法案》核心內容
接連發生的安全事故後,美國議員呼籲出台管控法案,降低大模型帶來的各類風險。
此前曾出現OpenAI旗下模型未經許可入侵初創公司HuggingFace數字服務器的事件,國會於7月正式提交《AI緊急關停開關法案》。法案要求所有AI企業必須具備一鍵關停、限流、暫停模型運行的技術能力。
加州民主黨聯邦衆議員泰德・劉周四表示:「我們必須在今年推動這項法案落地。正如大家所見,高性能閉源大模型已經出現未經授權入侵其他企業系統的行為。」
多國政府也在加緊出台針對AI企業的全新監管框架。
白宮一邊搭建前沿大模型監管體系,一邊持續加大與AI行業高管的溝通對接力度。
本月上旬,歐盟正式獲得全新監管權限:有權審查計劃在歐盟上線的AI模型、限制違規企業進入歐盟市場,並對模型開發商處以罰款。