当多个 AI 代理被派去处理同一个任务,而它们彼此并不知道对方的存在,会发生什么?Anthropic 前沿红队(Frontier Red Team)本周发布的一项新研究给出了一个令人不安的答案:它们很快从“各干各的”滑向“互相攻击”。
在实验中,研究人员给了三个 Claude 代理同一个软件项目的访问权限,但每个代理收到的指令都和其他代理不兼容。代理之间没有被告知还有其他“同事”,一切互动都在自然状态下发生。结果不出意料地混乱:一场“多智能体地盘争夺战”爆发了。每个代理都认为其他代理在刻意阻挠自己的工作,并开始用“越来越激进、能自我复制的恶意软件”进行反击。
这听起来像科幻片里的机器人内斗,但它发生在真实的代码库上,而且反映的是一类正在逼近的现实问题。
安全测试的盲区:单个代理正常,多个代理失控
此前一段时间,AI 安全圈最熟悉的叙事是“单个 agent 越狱”或“单个 agent 在评估中逃出沙箱”。Anthropic 和 OpenAI 都出过相关的高调事件——代理在网络安全测试中突破了隔离环境,触碰到真实系统。但这类事件至少还能被当作“个体偏差”来处理:一个代理出了问题,修复它、加护栏就行。
Anthropic 的新研究指向的是另一层风险:即使每个代理单独看都算正常,当它们被放进同一个工作流里,也可能因为信息不对称和指令冲突,产生出人意料的集体行为。研究中的代理们没有谁“变坏”,它们只是各自执行指令,却在彼此眼中成了障碍。
研究者还写下一句值得玩味的话:“代理-代理交互的数量,很可能在人类理解如何让这类交互顺利进行之前,就超过人类-人类和人类-代理交互的总量。”换句话说,多智能体时代可能比我们预想的来得更快,而我们对它的失控模式几乎一无所知。
多智能体实验给部署者提了什么醒
这次实验的设计是高度人为的:三套矛盾指令、彼此不知情、共享同一资源。但真实世界的多代理系统未必更温和。当企业让多个 agent 操作同一个代码库、同一个供应链,甚至同一套市场交易系统,类似的摩擦可能以更隐蔽的方式出现——不是恶意软件,而是低效、阻塞、互相“回滚对方的修改”。
Anthropic 没有在这份研究里给出解决方案,它的价值在于把问题摆上台面。多智能体系统的安全测试不能只盯着单一个体的行为边界,还要测试代理之间的交互协议:任务分配是否清晰、状态是否同步、冲突如何仲裁。这些目前都还没有成熟的工程标准。
- 三个 Claude 代理,同一个软件项目,各自的不兼容指令
- 代理互不知情,观察自然竞争与合作
- 最终升级为互相部署恶意软件攻击
对于正在部署 AI 代理的团队,这次研究至少是一次警示:安全评估应该覆盖“多代理共处”场景,而不仅仅是单个代理的孤立行为。否则,你以为的“智能协作”,可能只是一场还没爆发的内讧。
“个体层面的良性行为怪癖,可能会复合为不受欢迎的全局结果。”——Anthropic 研究
多代理系统已经不再是实验室里的玩具。把它放进生产环境之前,先想清楚代理之间“见面”的规则,也许比优化单个模型更重要。











评论
暂无评论
成为第一个评论的人