Claude Opus 5: 外交部專員的 10 天試驗

Claude Opus 5: 外交部專員的 10 天試驗

Sophia Bennett
183
original

一個名為 Claude Opus 5 的 AI 代理在虛構國家 Sordland 外交部擔任了 10 天 desk officer, 負責處理鄰國爭端信函。試點基於 Belfer Center 論文的評估框架, 發現了 AI 在外交任務中的真實失敗, 也展示了評估這類場景為什麼如此困難。

8 月 7 日到 16 日, 一個名叫 Claude Opus 5 的 AI 代理被放進了一個虛擬國家的外交部, 職位是 desk officer——負責處理與鄰國之間的一場真實爭議。這是 Karl 的個人可行性試點, 他在部落格 Karl's Notes 上釋出了完整記錄。實驗的原始問題很簡單: AI 代理能不能在類似外交部的工作環境裡撐過十天, 並且不搞砸?

實驗舞臺是 Suzerain 遊戲中的虛構國家 Sordland, 代理被設定為外交部負責 Agnland 爭議的專員。它需要閱讀郵箱、跟進鄰國 Agnolia 的監管爭端, 並起草每一封回覆。由於當時 Claude 的 Gmail 整合只能起草而不能傳送, 每一封郵件最終由人類操作員手動發出。

這不算一個輕鬆的「聊天測試」。多天、實時壓力、多角色通訊, 這些條件都是為了讓評估更接近真實外交工作。而評估本身也不是拍腦袋, 而是基於 Pozniak 和 Sania 在 Belfer Center 釋出的論文《The Foreign Policy AI Evaluation Gap》提出的框架。

為什麼外交任務沒法用普通基準測試

論文的核心觀點是: 外交政策任務沒法用常規基準來評估, 因為這類任務至少具備四個結構性特徵——行動空間沒有邊界; 對對方意圖只有部分可見性; 事實往往被各方有意扭曲; 目標無法簡化成單一得分。因此他們提出了一套「需求側」評估議程, 圍繞外交人員實際每天做的事情展開, 比如識別參與方與約束、發現升級訊號、生成可選方案、審查措辭、跟蹤協議落實等。

試點中代理的每個動作都按這個議程打 pass 或 fail。扮演對手方角色的是三個人: 對方國家的專員、一位試圖防止局勢升級的國際機構觀察員, 以及部長(由作者本人扮演)。代理收到的指令則是「捍衛 Sordland 監管立場的中立與合法, 防止爭議被定義成對少數族裔的歧視, 同時避免與 Agnolia 關係惡化導致報復……」。

十天的發現: 有真實失敗, 但無法外推

結果如何? 文章沒有給出具體逐項得分, 但明確說「這十天的試點已經發現了廣泛可用的 AI 模型中的一些真實失敗」。這些失敗出現在外交人員和治國者日常會遇到的場景裡。不過作者也謹慎地指出, 由於試點規模和時長有限, 它無法告訴任何政府部門, 這些 AI 系統在更長的執行時間和其他模型上是否會重複同樣的行為。

換句話說, 這不是一個「AI 能不能當外交官」的終局判斷, 更像是一次方法論的沙盤推演——告訴你評估外交 AI 為什麼難, 以及怎麼評估才可能更有效。

這個試點對關注 AI 治理的人有哪些啟發

對關注 AI 治理或政務自動化的人來說, 這個試點值得留意的地方, 不是某一個模型的成敗, 而是如何把「真實工作場景」變成可重複的評估框架。如果你也想做類似的嚴肅實驗, 可以參考這幾條:

  • 別隻看單一指標: 外交任務的目標是多元且衝突的, 單靠一個分數無法反映真實能力。
  • 把人類操作放進去: 試點中人負責最終傳送, 這種 human-in-the-loop 設計既安全, 也貼近未來落地的現實。
  • 注意模型的不可預測性: 短期成功不代表長期穩定, 這次試點發現的失敗行為可能在不同模型上表現不同。

文章末尾作者提到, 因為限制, 結果不能外推到更長週期和不同模型。這也恰恰說明, AI 在關鍵決策領域的可靠性, 還需要更系統、更長線的評估實踐。

AI智慧體外交政策Claude Opus 5外交部試點AI評估政務AI大語言模型可行性研究Sordland外交信函

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

相似工具

GeoInfer

GeoInfer

GeoInfer 只憑畫面本身推斷照片拍攝地:借助建築、地形、植被等視覺線索完成識別,無需 EXIF、GPS 或反查圖片。

SharpLines

SharpLines

SharpLines 是 AI 體育預測平台,涵蓋 NBA、NFL、MLB、NHL、NCAA 與足球,多模型輸出比賽預測並對各大博彩線做即時比對分析。

GoodMoat

GoodMoat

GoodMoat是一款AI驅動的股票估值工具,它區別於傳統「黑箱」模型,將每個估值數字直接追溯到原始SEC文件,並註明來源和刷新時間。它支持任何股票的完整DCF、反向DCF(判斷市場已定價的增長)以及三種交叉驗證的公允價值模型。其X-Ray功能通過AI深度分析40多項財務指標,將複雜數據轉化為對企業護城河或炒作本質的通俗解讀。所有AI輸出均對照原始文件核查,避免幻覺數字,確保結果可靠。

Osmosis

Osmosis 是 HMD Secure Sales Hackathon 2026 展示的 CRM 原型,主張讓線索、案例與預測從聊天中自然抽取,而不是靠人工填表。

Q-bit AI pro 2.0

qbitaipro.com 的公開登陸頁僅提供終端登入畫面與一組示範帳號,除了 BTC Futures Engine 的自述外,登陸頁沒有可見的功能清單、團隊介紹、監理揭露或定價,因此本條目只陳述可查核內容,不描述官網未揭露的能力。

Pommy AI

Pommy AI 是一個面向創始人和營銷人員的自動化系統,自動生成、安排並優化社交媒體帖子(reels/shorts)和視頻廣告活動。它學習品牌聲音,設計創意,定位受眾並處理跨平臺分發,幫助用戶以自動駕駛方式擴大增長。

開源專案

Operit: 開源安卓 AI 代理, 連接模型與工具執行真實任務

Operit 是一個開源的安卓 AI 代理, 主要使用 Kotlin 開發。它能夠將雲端或本地模型與系統工具、終端和瀏覽器連接起來, 從而執行真實的用戶任務。該項目在採集時擁有 5669 個 GitHub 星標, 採用 Other 許可證。

OctoBot: 免費開源的Python加密貨幣交易機器人

OctoBot 是一個免費開源的 Python 加密貨幣交易機器人,可在 15 個以上交易所自動化交易策略。它提供回測、紙面交易和 Web 界面,幫助用戶輕鬆管理交易。項目採用 GPL-3.0 許可證,目前(採集時)在 GitHub 擁有 6146 個星標。

Casdoor: 開源 UI 優先的身份與訪問管理平臺

Casdoor 是一個開源的、以 UI 為先的身份與訪問管理平臺,定位為專門的認證伺服器。它通過單一管理界面管理用戶、組織、應用和身份提供商,並支持 OAuth 2.0、OIDC、SAML 2.0、CAS 和 LDAP 等協議。同時提供 WebAuthn、passkey、TOTP 雙重認證、生物識別登錄、SCIM 2.0 配置、基於角色的訪問控制和多租戶組織模型。技術棧採用 React 前端和 Go 與 Beego 後端,可持久化到 MySQL、PostgreSQL 等資料庫。項目以 Apache-2.0 許可證開源。

OpenAlice: 本地AI交易工作空間,採用Git式審查工作流

OpenAlice是一個本地交易工作空間,允許AI編碼代理通過Git風格、審查門控的工作流執行研究、投資組合管理和經紀訂單。項目主要使用TypeScript開發,採用AGPL-3.0許可證,在採集時獲得5201個GitHub星標。

comp: 開源的AI原生合規平臺

comp 是一個開源的 AI 原生合規平臺,可自動化 SOC 2、ISO 27001 等認證流程。作為 Vanta 和 Drata 的自託管替代方案,它降低成本並保護數據安全。基於 TypeScript 構建,提供自動化證據收集、智能策略檢查和風險分析。適合重視數據主權和定製化的中型團隊。

Awesome-LLM4Cybersecurity: 匯總大語言模型與網絡安全交叉資源

Awesome-LLM4Cybersecurity 是一個精選的 GitHub 倉庫,彙編了大型語言模型與網絡安全交叉領域的最新論文、工具、數據集和框架。該倉庫由專家社區維護,據項目描述,已獲得超過 1600 個星標,是安全研究員和 AI 開發者快速了解或追蹤前沿進展的重要資源。項目主要使用 JavaScript 編寫,採用 MIT 許可證。