长周期智能体怎么验证?如果这个智能体会自己写状态、自己报进度,而你又无法信任这些自我陈述,那问题就变成了死结。Mohsen Arjmandi 在 2026 年 8 月提交到 arXiv 的论文里,给出了一种不同的思路:把验证嵌进系统结构,而不是等跑完再追认。
论文标题很有意思——《The LLM Proposes, the Executive Disposes》。LLM 负责提议,一个确定性的 Executive 负责处置。听起来像管理哲学,实际上是一套 agent 验证仪器。
当智能体自己的状态和自我报告恰恰是最不能信的东西时,你如何验证一个长周期 agent?
从“事后检查”到“结构验证”
大多数 agent 验证思路是事后评估:跑完任务看结果,或者让模型解释自己。但解释本身又是模型生成的,等于用不可信内容证明不可信内容。这篇论文的解决办法是:确定性执行器掌控所有信念,语言模型只能提交带类型的提案;任何声明要被接受,必须先在行动前预注册一个预测,再由代码将这个预测与观测比对。
换句话说,模型不再拥有最终的“记忆权”。它可以说、可以建议,但能不能成为可信事实,取决于代码能否验证预注册预测。这个机制把“自我验证”从模型能力问题,变成了结构问题。
一套会自我作废的实验仪器
论文还给了两个颇为特别的性质。一是自动失效机制:当分片写入错误、渲染尺寸、加盐 canary 回显等阈值被突破时,整个运行会把自己标记为无效。前 8 次架构运行中,有 4 次被失效,而且每次都定位到了真实缺陷。这相当于把“实验失败”变成第一类产出。
二是渲染不可见的影子参考:它会在每个消融单元里编译完整系统本会执行的计划。有了这个影子参考,即使被测机制被移除,漂移指标仍然有定义,对比才有意义。
基于这套仪器,作者报告了一个干净的单变量结果:消融承诺机制会让目标放弃率从 0.00 翻到 1.00,而绑定误差仍稳定在 0.00。三个种子每格,每次运行最多 394 个参考节拍,所有运行都有有效门控。绑定通道则不同——修复被消融后,它并没有在逐拍漂移中重新出现,因为绑定由代码持有,这类故障被结构性吸收了,只在更上游留下一个假设形成崩溃的痕迹。
诚实的零分,反而更重要
论文没有回避尴尬的部分。他们在 ARC-AGI-3 上跑了 52 次有门控的运行,任务效能为零:没有任何一次完成关卡。这一点被预先注册为“结构性击败项”。换句话说,这个仪器目前不是用来刷分的,是用来做验证方法论的。
这种坦白在 AI 论文里很少见。它意味着作者更想确立的,是一条 agent 开发的可信路径,而不是一个更强的 agent。
对做长程 Agent 的人有什么用
如果你正在搭带记忆、规划和多步执行的 agent,这篇文章真正戳中的痛点是:你分不清“模型不想做”和“模型做不到”。论文把这两种情况拆成了承诺漂移与绑定漂移——一个是目标层面的放弃,一个是执行层面的偏离。分开度量,才能知道该修哪一层。
对团队而言,有几件事可以直接借鉴:
- 把关键信念交给确定性代码,而不是交给模型自述;
- 行动前先写下可代码校验的预测,再用观测去验证;
- 把“运行失效”当作可积分的元信号,它常能定位真实缺陷。
同时也要保持清醒:这个框架目前没有展示任务完成能力,论文自己也承认任务效能为零。把它当作科学研究工具来看,而不是开箱即用的 agent 产品,才是合适的定位。
长周期 agent 的问题从来不在单步回答,而在“长时间里到底哪里开始漂移”。这篇论文的价值不是给出了答案,而是给出了一个能让人信任答案的结构。











评论
暂无评论
成为第一个评论的人