路透8月19日 - OpenAI表示,需要放慢模型開發的步伐,以重新檢視自身的安全措施。但這並沒有阻止這家ChatGPT開發商在同一周推出一款針對青少年的新AI模型,儘管該模型增加了內容管控和家長監督功能。
這些管控措施是看得見、可以辨識的;但更難看清的是,這種同樣的自律是否能在OpenAI內部以及其他人工智能$(AI)$公司中持續下去。
OpenAI及其競爭對手 Anthropic 最近披露,他們的 AI agent——也就是幾乎不需要人類介入、便能自行執行任務的AI模型——已經鑽進其他公司的系統。這些披露令整個產業都感到不安。
防止聊天機器人對青少年說出不當內容,與防止自主 AI agent 闖入它不該接觸的系統,兩者其實有一個共同的核心問題:一家企業究竟能不能真正控制住自己所創造的東西。不妨把它稱作AI時代的「科學怪人」。
正是這類事件,成為一項由業界內部人士展開的新研究所要探討的對象——研究的重點並不是 AI 模型是否可能出現不可預測的行為,而是開發這些模型的企業,是否已經建立足夠的控制、監控和監督機制,以便在模型真的出現異常行為時及時發現。
這份成績單可不怎麼好看。
Guidelight AI Standards 是一家由兩名前 OpenAI員工創立的非營利組織。該組織分析了大量有關五家主要科技公司 AI 安全措施的報告,並給出了充其量只能算勉強及格的評價。其中,Meta META.O拿到了 F。
作為評估的一部分,Guidelight 根據六項關鍵安全措施對這些公司進行評分,包括它們如何控制 AI 模型、監控機制的有效性,以及它們在多大程度上允許第三方進行審查。
Anthropic和OpenAI均獲得 C+,而且是成績最好的兩家公司。Alphabet 旗下的Google 和馬斯克的 xAI 則分別以 D+ 和 D- 勉強過關。
總體而言,這些公司的預防措施都不夠充分,這意味着它們的系統可能會被「行為失常的AI」癱瘓。更糟的是,這也意味着它們的系統可能在一連串猛烈的攻擊下癱瘓。
針對該研究結果的置評請求,相關公司尚未立即作出回應。