特朗普政府就旗艦AI模型安全漏洞問題向Anthropic發出最後通牒,但獨立安全專家警告稱,白宮的要求或許根本無法實現。
18日,特朗普政府官員告訴媒體,若Anthropic希望重新發布旗艦模型Claude Fable 5,該公司必須切實解決政府所指的安全漏洞,而非繼續辯解相關風險是否被高估。這一立場標誌着雙方分歧正迅速走向攤牌。Fable 5於上周因越獄(jailbreak)擔憂而被出口管制措施迫使下線——越獄是指通過特定提示詞繞過模型安全護欄的攻擊手法。
Anthropic方面在與商務部及國家網絡總監辦公室Sean Cairncross的周一技術會議上重申,政府的擔憂被過度渲染,越獄攻擊的實際影響有限。然而,美國國家安全局(NSA)已得出結論:Fable 5的安全護欄存在可被繞過的途徑,這些護欄原本用於防止用戶訪問其底層模型Mythos在網絡安全、化學和生物領域的敏感能力。據媒體援引三位知情人士透露,政府目前實際上已將解決問題的責任完全歸於Anthropic,而非試圖共同介入排查。
這場監管拉鋸戰揭示出AI治理的深層困境:政府是否有能力、有意願對前沿模型安全負責,以及"無越獄"這一監管目標是否具備技術可行性,直接影響Anthropic及整個AI行業的商業前景。
政府劃定紅線:主動測試,主動上報
據媒體援引知情人士透露,商務部AI標準與創新中心及NSA均表示,沒有足夠人員和精力去追蹤市場上每一款模型的所有潛在越獄路徑。基於這一現實,政府的立場已從"與Anthropic共同界定風險嚴重程度"轉向"要求Anthropic承擔全部合規責任"。
官員明確要求,Anthropic不僅需解決Fable 5的現有問題,還應對其所有前沿AI模型持續開展主動安全測試,自行發現潛在越獄漏洞,並主動向政府報告。這實際上意味着,政府要求Anthropic建立一套以企業自我監管為核心的合規機制,而非依賴監管機構的外部審查。
白宮發言人拒絕就此事置評。
技術爭議:安全護欄是否有解?
圍繞這場監管博弈,一個更根本的技術問題正在浮出水面:完全阻止越獄是否可行?
獨立網絡安全專家的主流觀點日益傾向於否定。專家認為,AI模型的安全護欄本質上只是臨時性的防禦措施,熟練用戶乃至未來的AI模型終將找到繞過限制的方法。這意味着白宮所要求的目標,在技術上存在根本性障礙。
Anthropic上周已向政府表達了類似立場,堅持認為越獄影響"微乎其微",但這一論點顯然未能說服官方——NSA的技術評估成為政府立場的關鍵依據,使雙方在事實層面的分歧難以彌合。
對Anthropic而言,Fable 5的下線不僅意味着商業損失,更預示着未來每一款前沿模型在發布前都可能面臨類似的監管障礙。若"零越獄"成為不成文的上市門檻,整個AI行業的研發節奏和商業化路徑將面臨實質性壓力。