LLM Proposes: 長程 Agent 漂移可測量

LLM Proposes: 長程 Agent 漂移可測量

Marcus Chen
18
original

這篇 arXiv 論文提出以確定性 Executive 掌控信念、LLM 只遞交提案的自驗證儀器,用預註冊預測和程式碼比對做結構驗證,並拆開承諾漂移與繫結漂移。任務效能為零的披露反而讓驗證方法更有說服力。

長週期智慧體怎麼驗證?如果這個智慧體會自己寫狀態、自己報進度,而你又無法信任這些自我陳述,那問題就變成了死結。Mohsen Arjmandi 在 2026 年 8 月提交到 arXiv 的論文裡,給出了一種不同的思路:把驗證嵌進系統結構,而不是等跑完再追認。

論文標題很有意思——《The LLM Proposes, the Executive Disposes》。LLM 負責提議,一個確定性的 Executive 負責處置。聽起來像管理哲學,實際上是一套 agent 驗證儀器。

當智慧體自己的狀態和自我報告恰恰是最不能信的東西時,你如何驗證一個長週期 agent?

從「事後檢查」到「結構驗證」

大多數 agent 驗證思路是事後評估:跑完任務看結果,或者讓模型解釋自己。但解釋本身又是模型生成的,等於用不可信內容證明不可信內容。這篇論文的解決辦法是:確定性執行器掌控所有信念,語言模型只能提交帶型別的提案;任何宣告要被接受,必須先在行動前預註冊一個預測,再由程式碼將這個預測與觀測比對。

換句話說,模型不再擁有最終的「記憶權」。它可以說、可以建議,但能不能成為可信事實,取決於程式碼能否驗證預註冊預測。這個機制把「自我驗證」從模型能力問題,變成了結構問題。

一套會自我作廢的實驗儀器

論文還給了兩個頗為特別的性質。一是自動失效機制:當分片寫入錯誤、渲染尺寸、加鹽 canary 回顯等閾值被突破時,整個執行會把自己標記為無效。前 8 次架構執行中,有 4 次被失效,而且每次都定位到了真實缺陷。這相當於把「實驗失敗」變成第一類產出。

二是渲染不可見的影子參考:它會在每個消融單元裡編譯完整系統本會執行的計劃。有了這個影子參考,即使被測機制被移除,漂移指標仍然有定義,對比才有意義。

基於這套儀器,作者報告了一個乾淨的單變數結果:消融承諾機制會讓目標放棄率從 0.00 翻到 1.00,而繫結誤差仍穩定在 0.00。三個種子每格,每次執行最多 394 個參考節拍,所有執行都有有效門控。繫結通道則不同——修復被消融後,它並沒有在逐拍漂移中重新出現,因為繫結由程式碼持有,這類故障被結構性吸收了,只在更上游留下一個假設形成崩潰的痕跡。

誠實的零分,反而更重要

論文沒有迴避尷尬的部分。他們在 ARC-AGI-3 上跑了 52 次有門控的執行,任務效能為零:沒有任何一次完成關卡。這一點被預先註冊為「結構性擊敗項」。換句話說,這個儀器目前不是用來刷分的,是用來做驗證方法論的。

這種坦白在 AI 論文裡很少見。它意味著作者更想確立的,是一條 agent 開發的可信路徑,而不是一個更強的 agent。

對做長程 Agent 的人有什麼用

如果你正在搭帶記憶、規劃和多步執行的 agent,這篇文章真正戳中的痛點是:你分不清「模型不想做」和「模型做不到」。論文把這兩種情況拆成了承諾漂移與繫結漂移——一個是目標層面的放棄,一個是執行層面的偏離。分開度量,才能知道該修哪一層。

對團隊而言,有幾件事可以直接借鑑:

  • 把關鍵信念交給確定性程式碼,而不是交給模型自述;
  • 行動前先寫下可程式碼校驗的預測,再用觀測去驗證;
  • 把「執行失效」當作可積分的元訊號,它常能定位真實缺陷。

同時也要保持清醒:這個框架目前沒有展示任務完成能力,論文自己也承認任務效能為零。把它當作科學研究工具來看,而不是開箱即用的 agent 產品,才是合適的定位。

長週期 agent 的問題從來不在單步回答,而在「長時間裡到底哪裡開始漂移」。這篇論文的價值不是給出了答案,而是給出了一個能讓人信任答案的結構。

長週期AgentAgent驗證結構式驗證承諾漂移繫結漂移arXiv論文AI智慧體長週期Agent驗證自我驗證方法

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多