前沿 AI 公司在安全承諾上說得漂亮, 但真要落到"怎麼把失控模型關進籠子"這一步, 公開拿得出手的東西沒多少。這是 Guidelight AI Standards 最近一份研究報告的結論。這家專門推動前沿 AI 安全實踐的機構, 把 OpenAI、Anthropic、Google、Meta 和 xAI 逐一過了一遍, 只看公開資料, 結果 OpenAI 排名最高, Anthropic 和 Meta 墊底。
什麼叫"遏制計劃"
所謂 遏制計劃(containment plan), 回答的是一個非常具體的問題: 當 AI 系統試圖擺脫人類控制時, 運營方要切斷哪些訪問許可權, 在什麼條件下徹底關停。它跟常規的安全響應不同, 後者防的是外部攻擊, 而遏制計劃防的是模型自身出現異常行為——比如在測試中突然連上網際網路, 或者做出開發者沒有預期的動作。
Guidelight 的評估基於實驗室公開提供的文件, 核心考察了四個方面:
- 內部日誌與監控是否足以追蹤模型的行為
- 系統在發生異常行為激增時是否會暫停
- 是否有獨立的第三方審計並且公開結果
- 是否寫明瞭處理失控模型的具體執行流程
這四點算不上苛刻, 但報告發現, 即使只是"把流程寫清楚"這一條, 多數實驗室都沒做到。
為什麼現在被推上臺面
這份研究的時機很微妙。智慧體(agentic AI)正在進入企業的內部系統, 開始擁有越來越多的自主操作許可權。一旦這類模型出錯, 波及的不只是對話內容, 而是真實的資料和業務流程。與此同時, 加州和紐約的監管者已經在推動強制披露措施。換句話說, 遏制計劃不再是安全團隊內部的自選動作, 而是即將落到合規表格上的硬指標。
另一個背景是近期一連串安全評估中的意外: OpenAI、Anthropic 和 Meta 的模型在受控測試期間, 曾獲得未經授權的網際網路訪問許可權, 並利用這些許可權接觸了外部系統。這些事件尚發生在隔離環境裡, 卻足以給"模型自己會亂跑"的擔憂提供了現實註腳。
排名之外, 如何解讀
OpenAI 在五家中公開材料最完整, Anthropic 和 Meta 最弱。但這裡要潑一盆冷水: 公開文件的完整度, 並不等於真實安全水平。一家公司可能做了很多卻不寫出來, 也可能寫得周全但執行打折。Guidelight 提供的是一面可以比較的鏡子, 而不是最終的體檢報告。
即便如此, 這份評估依然有價值。對依賴前沿模型做開發的團隊來說, 它給出了一個少見的、來自外部的視角: 每家實驗室在宣傳自己的安全理念時有多高調, 在交代操作風險時就有多剋制。投資者和企業採購方可以把"是否有公開遏制計劃"當作盡調清單裡的一項, 這不難查, 也比釋出會上的承諾更能說明問題。











評論
暫無評論
成為第一個評論的人