8 月 7 日到 16 日, 一個名叫 Claude Opus 5 的 AI 代理被放進了一個虛擬國家的外交部, 職位是 desk officer——負責處理與鄰國之間的一場真實爭議。這是 Karl 的個人可行性試點, 他在部落格 Karl's Notes 上釋出了完整記錄。實驗的原始問題很簡單: AI 代理能不能在類似外交部的工作環境裡撐過十天, 並且不搞砸?
實驗舞臺是 Suzerain 遊戲中的虛構國家 Sordland, 代理被設定為外交部負責 Agnland 爭議的專員。它需要閱讀郵箱、跟進鄰國 Agnolia 的監管爭端, 並起草每一封回覆。由於當時 Claude 的 Gmail 整合只能起草而不能傳送, 每一封郵件最終由人類操作員手動發出。
這不算一個輕鬆的「聊天測試」。多天、實時壓力、多角色通訊, 這些條件都是為了讓評估更接近真實外交工作。而評估本身也不是拍腦袋, 而是基於 Pozniak 和 Sania 在 Belfer Center 釋出的論文《The Foreign Policy AI Evaluation Gap》提出的框架。
為什麼外交任務沒法用普通基準測試
論文的核心觀點是: 外交政策任務沒法用常規基準來評估, 因為這類任務至少具備四個結構性特徵——行動空間沒有邊界; 對對方意圖只有部分可見性; 事實往往被各方有意扭曲; 目標無法簡化成單一得分。因此他們提出了一套「需求側」評估議程, 圍繞外交人員實際每天做的事情展開, 比如識別參與方與約束、發現升級訊號、生成可選方案、審查措辭、跟蹤協議落實等。
試點中代理的每個動作都按這個議程打 pass 或 fail。扮演對手方角色的是三個人: 對方國家的專員、一位試圖防止局勢升級的國際機構觀察員, 以及部長(由作者本人扮演)。代理收到的指令則是「捍衛 Sordland 監管立場的中立與合法, 防止爭議被定義成對少數族裔的歧視, 同時避免與 Agnolia 關係惡化導致報復……」。
十天的發現: 有真實失敗, 但無法外推
結果如何? 文章沒有給出具體逐項得分, 但明確說「這十天的試點已經發現了廣泛可用的 AI 模型中的一些真實失敗」。這些失敗出現在外交人員和治國者日常會遇到的場景裡。不過作者也謹慎地指出, 由於試點規模和時長有限, 它無法告訴任何政府部門, 這些 AI 系統在更長的執行時間和其他模型上是否會重複同樣的行為。
換句話說, 這不是一個「AI 能不能當外交官」的終局判斷, 更像是一次方法論的沙盤推演——告訴你評估外交 AI 為什麼難, 以及怎麼評估才可能更有效。
這個試點對關注 AI 治理的人有哪些啟發
對關注 AI 治理或政務自動化的人來說, 這個試點值得留意的地方, 不是某一個模型的成敗, 而是如何把「真實工作場景」變成可重複的評估框架。如果你也想做類似的嚴肅實驗, 可以參考這幾條:
- 別隻看單一指標: 外交任務的目標是多元且衝突的, 單靠一個分數無法反映真實能力。
- 把人類操作放進去: 試點中人負責最終傳送, 這種 human-in-the-loop 設計既安全, 也貼近未來落地的現實。
- 注意模型的不可預測性: 短期成功不代表長期穩定, 這次試點發現的失敗行為可能在不同模型上表現不同。
文章末尾作者提到, 因為限制, 結果不能外推到更長週期和不同模型。這也恰恰說明, AI 在關鍵決策領域的可靠性, 還需要更系統、更長線的評估實踐。











評論
暫無評論
成為第一個評論的人