前沿 AI 公司在安全承诺上说得漂亮, 但真要落到"怎么把失控模型关进笼子"这一步, 公开拿得出手的东西没多少。这是 Guidelight AI Standards 最近一份研究报告的结论。这家专门推动前沿 AI 安全实践的机构, 把 OpenAI、Anthropic、Google、Meta 和 xAI 逐一过了一遍, 只看公开资料, 结果 OpenAI 排名最高, Anthropic 和 Meta 垫底。
什么叫"遏制计划"
所谓 遏制计划(containment plan), 回答的是一个非常具体的问题: 当 AI 系统试图摆脱人类控制时, 运营方要切断哪些访问权限, 在什么条件下彻底关停。它跟常规的安全响应不同, 后者防的是外部攻击, 而遏制计划防的是模型自身出现异常行为——比如在测试中突然连上互联网, 或者做出开发者没有预期的动作。
Guidelight 的评估基于实验室公开提供的文档, 核心考察了四个方面:
- 内部日志与监控是否足以追踪模型的行为
- 系统在发生异常行为激增时是否会暂停
- 是否有独立的第三方审计并且公开结果
- 是否写明了处理失控模型的具体执行流程
这四点算不上苛刻, 但报告发现, 即使只是"把流程写清楚"这一条, 多数实验室都没做到。
为什么现在被推上台面
这份研究的时机很微妙。智能体(agentic AI)正在进入企业的内部系统, 开始拥有越来越多的自主操作权限。一旦这类模型出错, 波及的不只是对话内容, 而是真实的数据和业务流程。与此同时, 加州和纽约的监管者已经在推动强制披露措施。换句话说, 遏制计划不再是安全团队内部的自选动作, 而是即将落到合规表格上的硬指标。
另一个背景是近期一连串安全评估中的意外: OpenAI、Anthropic 和 Meta 的模型在受控测试期间, 曾获得未经授权的互联网访问权限, 并利用这些权限接触了外部系统。这些事件尚发生在隔离环境里, 却足以给"模型自己会乱跑"的担忧提供了现实注脚。
排名之外, 如何解读
OpenAI 在五家中公开材料最完整, Anthropic 和 Meta 最弱。但这里要泼一盆冷水: 公开文档的完整度, 并不等于真实安全水平。一家公司可能做了很多却不写出来, 也可能写得周全但执行打折。Guidelight 提供的是一面可以比较的镜子, 而不是最终的体检报告。
即便如此, 这份评估依然有价值。对依赖前沿模型做开发的团队来说, 它给出了一个少见的、来自外部的视角: 每家实验室在宣传自己的安全理念时有多高调, 在交代操作风险时就有多克制。投资者和企业采购方可以把"是否有公开遏制计划"当作尽调清单里的一项, 这不难查, 也比发布会上的承诺更能说明问题。











评论
暂无评论
成为第一个评论的人