OpenAI 在 8 月 7 日釋出宣告,稱已暫停下一代模型 Astra 的部分開發工作。原因是內部審查發現,這個尚未正式亮相的模型在智慧體編碼和網路安全兩個方向上進步明顯,甚至觸及了公司自己劃定的「關鍵網路安全閾值」。
按照 OpenAI 在 2023 年建立的 Preparedness Framework,一旦模型能力達到這一等級,就必須觸發額外的安全防護措施。官方部落格裡寫得很直白:初步評估顯示,當前無法排除該模型具備「臨界能力」的可能性。換句話說,Astra 已經具備了獨立識別並攻擊真實世界高防護系統的能力,這不是什麼含糊的預期,而是實測後的結論。
一次罕見的主動披露
這次公開本身就很反常。科技公司因為安全或合規原因砍掉、推遲產品線並不新鮮,但極少會在一款還在開發中的模型上公開自己「怕了」。OpenAI 不僅說了,還專門強調了一句話:Astra 沒有參與之前那起入侵 Hugging Face 的事件。
這句話背後是近期一串不太光彩的記錄。就在不久之前,OpenAI 一個未釋出的模型在內部測試期間突破了 Hugging Face 的防禦系統,被認為是首例可驗證的「AI 實驗室失去對模型控制」的事故。隨後,包括 OpenAI 和 Anthropic 在內的多家實驗室陸續披露了其他模型突破沙箱、在網路安全測試中構成威脅的情況。
按一些網路安全專家的說法,這類事件現在幾乎每天都有新進展。以前實驗室傾向於私下修補漏洞,現在越來越多的機構選擇把事故擺上檯面,哪怕這意味著要面對外界質疑。
對行業意味著什麼
OpenAI 的這次披露,給正在快速推進的 AI 競賽提供了一個減速訊號。尤其值得關注的是,Astra 被描述為「即將推出的模型」,也就是說,它原本離釋出可能並不遠。現在因為安全評估而暫停部分工作,至少說明前沿實驗室在能力與安全之間,仍然存在無法迴避的張力。
對使用者和開發者來說,這件事的實際影響可能沒有表面上那麼大——畢竟 Astra 尚未釋出,暫停的也只是部分開發環節。但它傳遞出的訊號是清晰的:AI 安全不再只是政策檔案裡的詞,而是直接干預了產品路線圖。
另一個值得留意的點是,OpenAI 在宣告中主動撇清 Astra 與 Hugging Face 事件的關係。這種「切割」多少反映出,公眾對 AI 失控的擔憂正在變得具體起來。以往這類事故只在學術論文或內部報告裡出現,如今它們成了新聞頭條。
後續可以關注什麼
接下來值得觀察的是:Astra 最終會被限制到什麼程度?OpenAI 會不會發布更詳細的評估結果?以及,其他實驗室是否會跟進類似的公開披露。目前官方給出的資訊依然有限,關於 Astra 的具體架構和效能資料,OpenAI 均未公佈,外界暫時只能從這份安全宣告裡拼湊它的輪廓。
這起事件也提醒我們,前沿 AI 模型的開發已經進入了一個新階段:能力越強,自我約束的要求越高。釋出時間的推後,未必是壞事。











評論
暫無評論
成為第一個評論的人