本週二,OpenAI 對外公佈了一套新的安全政策,目標是在模型測試階段更好地控制安全事件。這是自 7 月 21 日披露的 Hugging Face 安全事故之後,這家公司首次公開調整安全實踐。新措施並不複雜,核心是兩條:在開發過程中對模型進行更細粒度的監控,同時在後訓練階段把對齊與安全放在更重的位置。
新政策到底改了些什麼
按照官方部落格的說法,隨著模型能力越來越強,內部開發和測試帶來的風險也在同步上升,因此監控、對齊和安全的標準必須跑在風險前面。具體來看,更詳細的開發過程監控意味著團隊會在模型訓練和迭代的各個階段記錄更多行為資料,而不是等出了問題再回頭查;而後訓練階段的對齊與安全則對應著強化學習、安全微調等環節,要求在讓模型「變得更聽話」的同時,確保它不會在測試中暴露出危險能力。
- 開發過程監控:更細顆粒度地追蹤模型行為,儘早發現異常。
- 後訓練強化:在強化學習與評估環節增加對齊與安全權重。
- 分級管控:最大、最前沿的模型將面臨更嚴格的審查。
OpenAI 研究副總裁 Amelia Glaese 在記者溝通會上強調,控制措施的嚴格程度會隨模型能力水漲船高,能力越強的模型,受到的約束越多。這種「按能力分級」的思路,實際是在承認一個現實:統一的安全標準很難適用於所有規模的模型。
為什麼偏偏是現在
雖然 OpenAI 方面表示,新措施並非對 Hugging Face 事故的直接回應,但它確實承認,即將推出的 Astra 模型所具備的網路安全能力,以及整個 AI 領域的發展速度,也是推動這次調整的重要原因。換句話說,新規更像是一次前瞻性佈局——在更強大的模型上線前,先把安全護欄加固。
值得注意的是,同一篇部落格中還披露了一個細節:在 Hugging Face 事件發生後的兩週內,OpenAI 曾暫停了強化學習(RL)訓練,目前許多風險較低的模型已經恢復,但最大的前沿 RL 執行仍然處於擱置狀態。官方給出的解釋是,需要先進行小規模訓練和評估,確認模型行為、驗證安全措施,積累足夠的對齊證據,再考慮繼續推進。
對行業意味著什麼
這套組合拳的實際影響,可能不只是 OpenAI 內部流程的改變。對依賴 OpenAI API 的開發者來說,模型更新節奏可能放緩,尤其是前沿模型的迭代會變得更謹慎;對做 AI 安全的同行而言,OpenAI 把「開發過程監控」和「後訓練對齊」提上日程,相當於給出了一個新的行業參考框架。
眼下最值得關注的,是接下來的披露——Astra 模型的安全評估結果,以及最大 RL 執行何時重啟。這些動作會比釋出會的 PPT 更真實地反映 OpenAI 的安全底線在哪。











評論
暫無評論
成為第一個評論的人