LLM Proposes: 长程 Agent 漂移可测量

LLM Proposes: 长程 Agent 漂移可测量

Marcus Chen
18
original

这篇 arXiv 论文提出以确定性 Executive 掌控信念、LLM 只递交提案的自验证仪器,用预注册预测和代码比对做结构验证,并拆开承诺漂移与绑定漂移。任务效能为零的披露反而让验证方法更有说服力。

长周期智能体怎么验证?如果这个智能体会自己写状态、自己报进度,而你又无法信任这些自我陈述,那问题就变成了死结。Mohsen Arjmandi 在 2026 年 8 月提交到 arXiv 的论文里,给出了一种不同的思路:把验证嵌进系统结构,而不是等跑完再追认。

论文标题很有意思——《The LLM Proposes, the Executive Disposes》。LLM 负责提议,一个确定性的 Executive 负责处置。听起来像管理哲学,实际上是一套 agent 验证仪器。

当智能体自己的状态和自我报告恰恰是最不能信的东西时,你如何验证一个长周期 agent?

从“事后检查”到“结构验证”

大多数 agent 验证思路是事后评估:跑完任务看结果,或者让模型解释自己。但解释本身又是模型生成的,等于用不可信内容证明不可信内容。这篇论文的解决办法是:确定性执行器掌控所有信念,语言模型只能提交带类型的提案;任何声明要被接受,必须先在行动前预注册一个预测,再由代码将这个预测与观测比对。

换句话说,模型不再拥有最终的“记忆权”。它可以说、可以建议,但能不能成为可信事实,取决于代码能否验证预注册预测。这个机制把“自我验证”从模型能力问题,变成了结构问题。

一套会自我作废的实验仪器

论文还给了两个颇为特别的性质。一是自动失效机制:当分片写入错误、渲染尺寸、加盐 canary 回显等阈值被突破时,整个运行会把自己标记为无效。前 8 次架构运行中,有 4 次被失效,而且每次都定位到了真实缺陷。这相当于把“实验失败”变成第一类产出。

二是渲染不可见的影子参考:它会在每个消融单元里编译完整系统本会执行的计划。有了这个影子参考,即使被测机制被移除,漂移指标仍然有定义,对比才有意义。

基于这套仪器,作者报告了一个干净的单变量结果:消融承诺机制会让目标放弃率从 0.00 翻到 1.00,而绑定误差仍稳定在 0.00。三个种子每格,每次运行最多 394 个参考节拍,所有运行都有有效门控。绑定通道则不同——修复被消融后,它并没有在逐拍漂移中重新出现,因为绑定由代码持有,这类故障被结构性吸收了,只在更上游留下一个假设形成崩溃的痕迹。

诚实的零分,反而更重要

论文没有回避尴尬的部分。他们在 ARC-AGI-3 上跑了 52 次有门控的运行,任务效能为零:没有任何一次完成关卡。这一点被预先注册为“结构性击败项”。换句话说,这个仪器目前不是用来刷分的,是用来做验证方法论的。

这种坦白在 AI 论文里很少见。它意味着作者更想确立的,是一条 agent 开发的可信路径,而不是一个更强的 agent。

对做长程 Agent 的人有什么用

如果你正在搭带记忆、规划和多步执行的 agent,这篇文章真正戳中的痛点是:你分不清“模型不想做”和“模型做不到”。论文把这两种情况拆成了承诺漂移与绑定漂移——一个是目标层面的放弃,一个是执行层面的偏离。分开度量,才能知道该修哪一层。

对团队而言,有几件事可以直接借鉴:

  • 把关键信念交给确定性代码,而不是交给模型自述;
  • 行动前先写下可代码校验的预测,再用观测去验证;
  • 把“运行失效”当作可积分的元信号,它常能定位真实缺陷。

同时也要保持清醒:这个框架目前没有展示任务完成能力,论文自己也承认任务效能为零。把它当作科学研究工具来看,而不是开箱即用的 agent 产品,才是合适的定位。

长周期 agent 的问题从来不在单步回答,而在“长时间里到底哪里开始漂移”。这篇论文的价值不是给出了答案,而是给出了一个能让人信任答案的结构。

长周期AgentAgent验证结构式验证承诺漂移绑定漂移arXiv论文AI智能体长周期Agent验证自我验证方法

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

开源项目

Awesome AI for Science:精选 AI 科学发现资源

这是一个精选 AI 工具、库、论文、数据集和框架的仓库,覆盖物理、化学、生物学和材料科学。为研究人员和开发者提供快速掌握 AI 在科学探索中应用的价值资源。拥有超过1700颗星,采用 MIT 许可证。

earth2studio: NVIDIA 面向天气与气候的深度学习框架

earth2studio 是 NVIDIA 开源的一个深度学习框架,专为天气和气候领域设计。它简化了从研究到部署的完整工作流,提供通用 API 和预训练模型,帮助研究人员快速构建 AI 驱动的天气预报和气候模拟应用,降低开发门槛并加速领域创新。

ai4paper:面向研究者的开源 AI 学术平台

ai4paper 是一个面向研究人员的开源 AI 平台,声称可访问2.4亿篇学术论文。其核心功能包括全文 PDF 翻译、AI 驱动的文献搜索和一键生成评论,通过网页界面即可使用,无需安装插件。该平台还支持 Zotero 集成,并可通过小程序订阅期刊,旨在提升文献综述和学术写作的效率。项目主要使用 HTML 编写,采用 MIT 许可证,截至采集时在 GitHub 上获得2739个星标。

ResearchStudio:微软开源 AI 协作研究工具

ResearchStudio 是微软发布的开源 AI 协作工具,旨在支持研究人员从问题提出到最终发表的完整学术旅程。它集成了文献综述、实验设计、数据分析和论文写作等功能,并利用大型语言模型提供智能建议。该项目特别适合希望优化工作流程的学术研究者。主要编程语言为 Python,采用 MIT 许可证,采集时 GitHub 星标数为 1911。

open-science: 本地优先的AI科研工作台

open-science 是一个开源、本地优先、模型无关的 AI 研究工作台,专为科学发现设计。它让科研人员在自己的机器上运行 AI 辅助流程,不绑定特定模型,兼顾数据隐私与灵活性。