訓練大語言模型智慧體去完成長週期的工具呼叫,一直是個燒錢又費力的活。常見的做法是讓它跟真實環境或合成可執行環境反覆互動,但這類環境的構建和驗證成本很高;換用外部模擬器,又往往難以對齊真實場景。最近 arXiv 上出現一篇題為 EnvACE 的論文,提出了一個很不一樣的角度:與其讓智慧體在外部環境裡摸爬滾打,不如讓它自己扮演環境。
換個思路:讓智慧體自己腦補環境
EnvACE 的核心概念叫 世界排練(world rehearsal)。訓練過程裡,策略不再需要外部環境來響應它的每一步操作,而是自己生成工具呼叫後,緊接著扮演環境的角色,想象出這次呼叫會引發什麼結果,再基於這個"腦補"出來的響應繼續決策。兩個角色——行動者與環境——在同一個模型裡交替切換,並用任務成功獎勵做端到端聯合優化。
聽起來有點像自問自答,但關鍵在於:通過這種排練,策略把"動作-環境響應"的規律直接內部化到引數裡,相當於在模型內部長出了一個智慧體世界模型。這個模型不是用來做預測的輔助模組,而是直接參與決策。
在多個測試基準上表現如何
論文在 BFCL-v4、tau²-Bench、VitaBench 和 FinMCP-Bench 上做了評估。結果顯示,EnvACE 的整體表現優於那些依賴擴充套件外部環境的基線方法,而且具備不錯的遷移能力。控制實驗還發現,世界排練在不同規模的模型上都能穩定地帶來策略提升,並不是只在特定引數量下才起作用。
更妙的是測試階段。因為世界模型已經被內化,智慧體在正式執行之前,可以先在內部做一輪私密排練(private rehearsal),預演一下結果。論文指出,在適度的排練預算下,這種做法能進一步帶來收益,而且全程不需要額外的外部互動。
這條路線為何值得關注
傳統的 agent 訓練高度依賴外部環境的質量和可得性。很多場景下,真實環境太貴、合成環境太難造,模擬器又不夠準。EnvACE 展示了一種可能性:把環境"裝進"模型引數裡,讓訓練過程從外部環境的約束中解放出來。
- 減少對外部環境的依賴,降低訓練基礎設施的搭建成本
- 訓練過程中無需執行真實工具呼叫,也降低了驗證環節的複雜度
- 內部世界模型在推理階段可複用,帶來額外收益
當然,這不是說外部環境就沒用了。腦補出來的響應終歸是模型自己的想象,存在幻覺風險。論文目前的實驗集中在工具呼叫這類結構化任務上,能否推廣到更開放的物理世界互動,還有待觀察。不過,作為一條新路徑,世界排練確實給 agentic RL 的研究開啟了一個新的視窗。
想跟進的開發者可以做什麼
論文作者已經在 arXiv 上公開了程式碼(連結見摘要頁)。如果你正在做 工具呼叫智慧體 的訓練,或者對 agentic reinforcement learning 感興趣,可以拿自己的任務試試看。建議從 BFCL-v4 這類公開基準入手,先復現論文裡的結果,再觀察模型在你自己的工具集上能否保持同樣的腦補效果。
同時也要留意侷限:世界排練的效果很大程度上取決於模型對環境的先驗知識,如果工具行為太冷門,模型可能想象不出合理響應。這也是未來工作需要解決的核心問題之一。
EnvACE 的價值不在於否定傳統環境互動,而是提供了一條更輕量的補充路線。對獨立研究者和小團隊來說,這意味著不用堆大量環境資源,也能探索 agent 訓練的新玩法。











評論
暫無評論
成為第一個評論的人