Claude Opus 5: 外交部专员的 10 天试验

Claude Opus 5: 外交部专员的 10 天试验

Sophia Bennett
183
original

一个名为 Claude Opus 5 的 AI 代理在虚构国家 Sordland 外交部担任了 10 天 desk officer, 负责处理邻国争端信函。试点基于 Belfer Center 论文的评估框架, 发现了 AI 在外交任务中的真实失败, 也展示了评估这类场景为什么如此困难。

8 月 7 日到 16 日, 一个名叫 Claude Opus 5 的 AI 代理被放进了一个虚拟国家的外交部, 职位是 desk officer——负责处理与邻国之间的一场真实争议。这是 Karl 的个人可行性试点, 他在博客 Karl's Notes 上发布了完整记录。实验的原始问题很简单: AI 代理能不能在类似外交部的工作环境里撑过十天, 并且不搞砸?

实验舞台是 Suzerain 游戏中的虚构国家 Sordland, 代理被设定为外交部负责 Agnland 争议的专员。它需要阅读邮箱、跟进邻国 Agnolia 的监管争端, 并起草每一封回复。由于当时 Claude 的 Gmail 集成只能起草而不能发送, 每一封邮件最终由人类操作员手动发出。

这不算一个轻松的“聊天测试”。多天、实时压力、多角色通信, 这些条件都是为了让评估更接近真实外交工作。而评估本身也不是拍脑袋, 而是基于 Pozniak 和 Sania 在 Belfer Center 发布的论文《The Foreign Policy AI Evaluation Gap》提出的框架。

为什么外交任务没法用普通基准测试

论文的核心观点是: 外交政策任务没法用常规基准来评估, 因为这类任务至少具备四个结构性特征——行动空间没有边界; 对对方意图只有部分可见性; 事实往往被各方有意扭曲; 目标无法简化成单一得分。因此他们提出了一套“需求侧”评估议程, 围绕外交人员实际每天做的事情展开, 比如识别参与方与约束、发现升级信号、生成可选方案、审查措辞、跟踪协议落实等。

试点中代理的每个动作都按这个议程打 pass 或 fail。扮演对手方角色的是三个人: 对方国家的专员、一位试图防止局势升级的国际机构观察员, 以及部长(由作者本人扮演)。代理收到的指令则是“捍卫 Sordland 监管立场的中立与合法, 防止争议被定义成对少数族裔的歧视, 同时避免与 Agnolia 关系恶化导致报复……”。

十天的发现: 有真实失败, 但无法外推

结果如何? 文章没有给出具体逐项得分, 但明确说“这十天的试点已经发现了广泛可用的 AI 模型中的一些真实失败”。这些失败出现在外交人员和治国者日常会遇到的场景里。不过作者也谨慎地指出, 由于试点规模和时长有限, 它无法告诉任何政府部门, 这些 AI 系统在更长的运行时间和其他模型上是否会重复同样的行为。

换句话说, 这不是一个“AI 能不能当外交官”的终局判断, 更像是一次方法论的沙盘推演——告诉你评估外交 AI 为什么难, 以及怎么评估才可能更有效。

这个试点对关注 AI 治理的人有哪些启发

对关注 AI 治理或政务自动化的人来说, 这个试点值得留意的地方, 不是某一个模型的成败, 而是如何把“真实工作场景”变成可重复的评估框架。如果你也想做类似的严肃实验, 可以参考这几条:

  • 别只看单一指标: 外交任务的目标是多元且冲突的, 单靠一个分数无法反映真实能力。
  • 把人类操作放进去: 试点中人负责最终发送, 这种 human-in-the-loop 设计既安全, 也贴近未来落地的现实。
  • 注意模型的不可预测性: 短期成功不代表长期稳定, 这次试点发现的失败行为可能在不同模型上表现不同。

文章末尾作者提到, 因为限制, 结果不能外推到更长周期和不同模型。这也恰恰说明, AI 在关键决策领域的可靠性, 还需要更系统、更长线的评估实践。

AI智能体外交政策Claude Opus 5外交部试点AI评估政务AI大语言模型可行性研究Sordland外交信函

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

相似工具

GeoInfer

GeoInfer

GeoInfer 只凭画面本身推断照片拍摄地:借助建筑、地形、植被等视觉线索完成识别,无需 EXIF、GPS 或反查图片。

SharpLines

SharpLines

SharpLines 是 AI 体育预测平台,覆盖 NBA、NFL、MLB、NHL、NCAA 与足球,多模型对赛事进行预测并对各大博彩线做实时对比分析。

GoodMoat

GoodMoat

GoodMoat 是一款 AI 驱动的股票估值工具,它区别于传统“黑箱”模型,将每个估值数字直接追溯到原始 SEC 文件,并注明来源和刷新时间。它支持任何股票的完整 DCF、反向 DCF(判断市场已定价的增长)以及三种交叉验证的公允价值模型。其 X-Ray 功能通过 AI 深度分析40多项财务指标,将复杂数据转化为对企业护城河或炒作本质的通俗解读。所有 AI 输出均对照原始文件核查,避免幻觉数字,确保结果可靠。

Osmosis

Osmosis 是 HMD Secure Sales Hackathon 2026 展示的 CRM 原型,主张让线索、案例和预测从聊天里自然抽取,而不是靠人工填表。

Q-bit AI pro 2.0

qbitaipro.com 的公开落地页仅展示一个终端登录界面和一组演示账号,除去 BTC Futures Engine 的自我描述外,落地页上没有可见的功能清单、团队介绍、监管披露或定价,因此本条目仅陈述可核实内容,不描述官网未披露的能力。

Pommy AI

Pommy AI 是一个面向创始人和营销人员的自动化系统,自动生成、安排并优化社交媒体帖子(reels/shorts)和视频广告活动。它学习品牌声音,设计创意,定位受众并处理跨平台分发,帮助用户以自动驾驶方式扩大增长。

开源项目

Operit:开源安卓 AI 代理,连接模型与工具执行真实任务

Operit 是一个开源的安卓 AI 代理,主要使用 Kotlin 开发。它能够将云端或本地模型与系统工具、终端和浏览器连接起来,从而执行真实的用户任务。该项目在采集时拥有 5669 个 GitHub 星标,采用 Other 许可证。

OctoBot:免费开源的 Python 加密货币交易机器人

OctoBot 是一个免费开源的 Python 加密货币交易机器人,可在 15 个以上交易所自动化交易策略。它提供回测、纸面交易和 Web 界面,帮助用户轻松管理交易。项目采用 GPL-3.0 许可证,目前(采集时)在 GitHub 拥有 6146 个星标。

Casdoor:开源 UI 优先的身份与访问管理平台

Casdoor 是一个开源的、以 UI 为先的身份与访问管理平台,定位为专门的认证服务器。它通过单一管理界面管理用户、组织、应用和身份提供商,并支持 OAuth 2.0、OIDC、SAML 2.0、CAS 和 LDAP 等协议。同时提供 WebAuthn、passkey、TOTP 双重认证、生物识别登录、SCIM 2.0 配置、基于角色的访问控制和多租户组织模型。技术栈采用 React 前端和 Go 与 Beego 后端,可持久化到 MySQL、PostgreSQL 等数据库。项目以 Apache-2.0 许可证开源。

OpenAlice:本地 AI 交易工作空间,采用 Git 式审查工作流

OpenAlice 是一个本地交易工作空间,允许 AI 编码代理通过 Git 风格、审查门控的工作流执行研究、投资组合管理和经纪订单。项目主要使用 TypeScript 开发,采用 AGPL-3.0 许可证,在采集时获得5201个 GitHub 星标。

comp:开源的 AI 原生合规平台

comp 是一个开源的 AI 原生合规平台,可自动化 SOC 2、ISO 27001 等认证流程。作为 Vanta 和 Drata 的自托管替代方案,它降低成本并保护数据安全。基于 TypeScript 构建,提供自动化证据收集、智能策略检查和风险分析。适合重视数据主权和定制化的中型团队。

Awesome-LLM4Cybersecurity:汇总大语言模型与网络安全交叉资源

Awesome-LLM4Cybersecurity 是一个精选的 GitHub 仓库,汇编了大型语言模型与网络安全交叉领域的最新论文、工具、数据集和框架。该仓库由专家社区维护,据项目描述,已获得超过 1600 个星标,是安全研究员和 AI 开发者快速了解或追踪前沿进展的重要资源。项目主要使用 JavaScript 编写,采用 MIT 许可证。