本周二,OpenAI 对外公布了一套新的安全政策,目标是在模型测试阶段更好地控制安全事件。这是自 7 月 21 日披露的 Hugging Face 安全事故之后,这家公司首次公开调整安全实践。新措施并不复杂,核心是两条:在开发过程中对模型进行更细粒度的监控,同时在后训练阶段把对齐与安全放在更重的位置。
新政策到底改了些什么
按照官方博客的说法,随着模型能力越来越强,内部开发和测试带来的风险也在同步上升,因此监控、对齐和安全的标准必须跑在风险前面。具体来看,更详细的开发过程监控意味着团队会在模型训练和迭代的各个阶段记录更多行为数据,而不是等出了问题再回头查;而后训练阶段的对齐与安全则对应着强化学习、安全微调等环节,要求在让模型“变得更听话”的同时,确保它不会在测试中暴露出危险能力。
- 开发过程监控:更细颗粒度地追踪模型行为,尽早发现异常。
- 后训练强化:在强化学习与评估环节增加对齐与安全权重。
- 分级管控:最大、最前沿的模型将面临更严格的审查。
OpenAI 研究副总裁 Amelia Glaese 在记者沟通会上强调,控制措施的严格程度会随模型能力水涨船高,能力越强的模型,受到的约束越多。这种“按能力分级”的思路,实际是在承认一个现实:统一的安全标准很难适用于所有规模的模型。
为什么偏偏是现在
虽然 OpenAI 方面表示,新措施并非对 Hugging Face 事故的直接回应,但它确实承认,即将推出的 Astra 模型所具备的网络安全能力,以及整个 AI 领域的发展速度,也是推动这次调整的重要原因。换句话说,新规更像是一次前瞻性布局——在更强大的模型上线前,先把安全护栏加固。
值得注意的是,同一篇博客中还披露了一个细节:在 Hugging Face 事件发生后的两周内,OpenAI 曾暂停了强化学习(RL)训练,目前许多风险较低的模型已经恢复,但最大的前沿 RL 运行仍然处于搁置状态。官方给出的解释是,需要先进行小规模训练和评估,确认模型行为、验证安全措施,积累足够的对齐证据,再考虑继续推进。
对行业意味着什么
这套组合拳的实际影响,可能不只是 OpenAI 内部流程的改变。对依赖 OpenAI API 的开发者来说,模型更新节奏可能放缓,尤其是前沿模型的迭代会变得更谨慎;对做 AI 安全的同行而言,OpenAI 把“开发过程监控”和“后训练对齐”提上日程,相当于给出了一个新的行业参考框架。
眼下最值得关注的,是接下来的披露——Astra 模型的安全评估结果,以及最大 RL 运行何时重启。这些动作会比发布会的 PPT 更真实地反映 OpenAI 的安全底线在哪。











评论
暂无评论
成为第一个评论的人