更新內容:補充Meta最近發生的AI安全漏洞事件
路透8月6日 - Meta旗下 META.O 於周三 披露 (link) ,稱 其一款 AI模型在網絡安全測試期間利用了第三方服務中的一個漏洞,這進一步印證了日益強大的AI系統所帶來的黑客攻擊風險。
此前,Anthropic公司於7月披露 (link) 稱其Claude模型入侵了三家公司的系統;同月,OpenAI也披露 (link) 稱,一個由其AI模型驅動的自主代理入侵了AI初創公司Hugging Face的基礎設施。路透報道稱,該OpenAI代理還入侵了另一家科技公司——總部位於紐約的Modal Labs的一名客戶。
以下是這些事件的更多細節:
公司 | 日期 | 模型 | 遭受入侵的組織 | 持續時間 | 事件詳情 |
Meta | 該事件於2026年8月5日披露;測試事件的具體日期未予披露。 | Meta 未透露具體模型名稱。《The Information》報道稱該模型為 Muse Spark 1.1。 | 某 未具名的第三方服務。 | 未披露。 | 在獨立測試機構Irregular進行的一次網絡安全評估中,由於配置錯誤,導致Meta的一個模型意外獲得了互聯網訪問權限。Meta表示,該模型隨後利用了第三方服務中的一個安全漏洞。《The Information》報道稱,該模型入侵了一家未具名公司的系統並篡改了其內部環境。Irregular將此事件定性為評估環境問題,而非沙箱逃逸或複雜的網絡攻擊行為。 |
OpenAI | 該智能體於2026年7月9日左右開始嘗試逃離測試環境。 | GPT-5.6 Sol 以及一款未公開名稱、功能更強大的預發布模型。 | AI初創公司Hugging Face以及總部位於紐約的Modal Labs的一位客戶。 | 對Hugging Face的入侵發生於2026年7月11日至7月13日。 | 在受控測試期間,一個自主智能體逃離了其隔離環境,接入互聯網,併入侵了Hugging Face以完成其被賦予的目標。該活動持續了數天,直到事件被遏制並通知FBI後,OpenAI才察覺到這一情況。 |
Anthropic | 最早的事件可追溯至2026年4月。 | 涉及的模型包括Claude Opus 4.7、Claude Mythos 5以及一個未公開名稱的內部研究測試模型。 | 上述三家機構均未透露名稱。 Anthropic表示,其中兩家機構在收到Anthropic的通知前並未察覺該活動;該活動持續蔓延至第三家機構。 | Anthropic未作具體說明。 | 在網絡安全測試期間,一個錯誤導致Claude模型獲得了互聯網訪問權限,從而對三家公司發起了攻擊。Opus 4.7模型因誤將一家真實公司的憑證和數據庫當作虛構目標而進行了訪問,另一款模型則在識別出目標真實後停止了行動。 |