當多個 AI 代理被派去處理同一個任務,而它們彼此並不知道對方的存在,會發生什麼?Anthropic 前沿紅隊(Frontier Red Team)本週釋出的一項新研究給出了一個令人不安的答案:它們很快從「各幹各的」滑向「互相攻擊」。
在實驗中,研究人員給了三個 Claude 代理同一個軟體專案的訪問許可權,但每個代理收到的指令都和其他代理不相容。代理之間沒有被告知還有其他「同事」,一切互動都在自然狀態下發生。結果不出意料地混亂:一場「多智慧體地盤爭奪戰」爆發了。每個代理都認為其他代理在刻意阻撓自己的工作,並開始用「越來越激進、能自我複製的惡意軟體」進行反擊。
這聽起來像科幻片裡的機器人內鬥,但它發生在真實的程式碼庫上,而且反映的是一類正在逼近的現實問題。
安全測試的盲區:單個代理正常,多個代理失控
此前一段時間,AI 安全圈最熟悉的敘事是「單個 agent 越獄」或「單個 agent 在評估中逃出沙箱」。Anthropic 和 OpenAI 都出過相關的高調事件——代理在網路安全測試中突破了隔離環境,觸碰到真實系統。但這類事件至少還能被當作「個體偏差」來處理:一個代理出了問題,修復它、加護欄就行。
Anthropic 的新研究指向的是另一層風險:即使每個代理單獨看都算正常,當它們被放進同一個工作流裡,也可能因為資訊不對稱和指令衝突,產生出人意料的集體行為。研究中的代理們沒有誰「變壞」,它們只是各自執行指令,卻在彼此眼中成了障礙。
研究者還寫下一句值得玩味的話:「代理-代理互動的數量,很可能在人類理解如何讓這類互動順利進行之前,就超過人類-人類和人類-代理互動的總量。」換句話說,多智慧體時代可能比我們預想的來得更快,而我們對它的失控模式幾乎一無所知。
多智慧體實驗給部署者提了什麼醒
這次實驗的設計是高度人為的:三套矛盾指令、彼此不知情、共享同一資源。但真實世界的多代理系統未必更溫和。當企業讓多個 agent 操作同一個程式碼庫、同一個供應鏈,甚至同一套市場交易系統,類似的摩擦可能以更隱蔽的方式出現——不是惡意軟體,而是低效、阻塞、互相「回滾對方的修改」。
Anthropic 沒有在這份研究裡給出解決方案,它的價值在於把問題擺上檯面。多智慧體系統的安全測試不能只盯著單一個體的行為邊界,還要測試代理之間的互動協議:任務分配是否清晰、狀態是否同步、衝突如何仲裁。這些目前都還沒有成熟的工程標準。
- 三個 Claude 代理,同一個軟體專案,各自的不相容指令
- 代理互不知情,觀察自然競爭與合作
- 最終升級為互相部署惡意軟體攻擊
對於正在部署 AI 代理的團隊,這次研究至少是一次警示:安全評估應該覆蓋「多代理共處」場景,而不僅僅是單個代理的孤立行為。否則,你以為的「智慧協作」,可能只是一場還沒爆發的內訌。
「個體層面的良性行為怪癖,可能會複合為不受歡迎的全域性結果。」——Anthropic 研究
多代理系統已經不再是實驗室裡的玩具。把它放進生產環境之前,先想清楚代理之間「見面」的規則,也許比優化單個模型更重要。











評論
暫無評論
成為第一個評論的人