8 月 7 日到 16 日, 一个名叫 Claude Opus 5 的 AI 代理被放进了一个虚拟国家的外交部, 职位是 desk officer——负责处理与邻国之间的一场真实争议。这是 Karl 的个人可行性试点, 他在博客 Karl's Notes 上发布了完整记录。实验的原始问题很简单: AI 代理能不能在类似外交部的工作环境里撑过十天, 并且不搞砸?
实验舞台是 Suzerain 游戏中的虚构国家 Sordland, 代理被设定为外交部负责 Agnland 争议的专员。它需要阅读邮箱、跟进邻国 Agnolia 的监管争端, 并起草每一封回复。由于当时 Claude 的 Gmail 集成只能起草而不能发送, 每一封邮件最终由人类操作员手动发出。
这不算一个轻松的“聊天测试”。多天、实时压力、多角色通信, 这些条件都是为了让评估更接近真实外交工作。而评估本身也不是拍脑袋, 而是基于 Pozniak 和 Sania 在 Belfer Center 发布的论文《The Foreign Policy AI Evaluation Gap》提出的框架。
为什么外交任务没法用普通基准测试
论文的核心观点是: 外交政策任务没法用常规基准来评估, 因为这类任务至少具备四个结构性特征——行动空间没有边界; 对对方意图只有部分可见性; 事实往往被各方有意扭曲; 目标无法简化成单一得分。因此他们提出了一套“需求侧”评估议程, 围绕外交人员实际每天做的事情展开, 比如识别参与方与约束、发现升级信号、生成可选方案、审查措辞、跟踪协议落实等。
试点中代理的每个动作都按这个议程打 pass 或 fail。扮演对手方角色的是三个人: 对方国家的专员、一位试图防止局势升级的国际机构观察员, 以及部长(由作者本人扮演)。代理收到的指令则是“捍卫 Sordland 监管立场的中立与合法, 防止争议被定义成对少数族裔的歧视, 同时避免与 Agnolia 关系恶化导致报复……”。
十天的发现: 有真实失败, 但无法外推
结果如何? 文章没有给出具体逐项得分, 但明确说“这十天的试点已经发现了广泛可用的 AI 模型中的一些真实失败”。这些失败出现在外交人员和治国者日常会遇到的场景里。不过作者也谨慎地指出, 由于试点规模和时长有限, 它无法告诉任何政府部门, 这些 AI 系统在更长的运行时间和其他模型上是否会重复同样的行为。
换句话说, 这不是一个“AI 能不能当外交官”的终局判断, 更像是一次方法论的沙盘推演——告诉你评估外交 AI 为什么难, 以及怎么评估才可能更有效。
这个试点对关注 AI 治理的人有哪些启发
对关注 AI 治理或政务自动化的人来说, 这个试点值得留意的地方, 不是某一个模型的成败, 而是如何把“真实工作场景”变成可重复的评估框架。如果你也想做类似的严肃实验, 可以参考这几条:
- 别只看单一指标: 外交任务的目标是多元且冲突的, 单靠一个分数无法反映真实能力。
- 把人类操作放进去: 试点中人负责最终发送, 这种 human-in-the-loop 设计既安全, 也贴近未来落地的现实。
- 注意模型的不可预测性: 短期成功不代表长期稳定, 这次试点发现的失败行为可能在不同模型上表现不同。
文章末尾作者提到, 因为限制, 结果不能外推到更长周期和不同模型。这也恰恰说明, AI 在关键决策领域的可靠性, 还需要更系统、更长线的评估实践。











评论
暂无评论
成为第一个评论的人