EnvACE: 用世界排練訓練長期工具呼叫 Agent

EnvACE: 用世界排練訓練長期工具呼叫 Agent

Grace Sullivan
145
original

EnvACE 提出世界排練方法,讓大語言模型智慧體在訓練中自己扮演環境,內部化環境動態,減少對外部模擬器的依賴。在 BFCL-v4、tau²-Bench 等基準上超越環境擴充套件基線,測試階段還能進行私密排練,為長期工具呼叫 agent 訓練提供新路徑。

訓練大語言模型智慧體去完成長週期的工具呼叫,一直是個燒錢又費力的活。常見的做法是讓它跟真實環境或合成可執行環境反覆互動,但這類環境的構建和驗證成本很高;換用外部模擬器,又往往難以對齊真實場景。最近 arXiv 上出現一篇題為 EnvACE 的論文,提出了一個很不一樣的角度:與其讓智慧體在外部環境裡摸爬滾打,不如讓它自己扮演環境。

換個思路:讓智慧體自己腦補環境

EnvACE 的核心概念叫 世界排練(world rehearsal)。訓練過程裡,策略不再需要外部環境來響應它的每一步操作,而是自己生成工具呼叫後,緊接著扮演環境的角色,想象出這次呼叫會引發什麼結果,再基於這個"腦補"出來的響應繼續決策。兩個角色——行動者與環境——在同一個模型裡交替切換,並用任務成功獎勵做端到端聯合優化。

聽起來有點像自問自答,但關鍵在於:通過這種排練,策略把"動作-環境響應"的規律直接內部化到引數裡,相當於在模型內部長出了一個智慧體世界模型。這個模型不是用來做預測的輔助模組,而是直接參與決策。

在多個測試基準上表現如何

論文在 BFCL-v4tau²-BenchVitaBenchFinMCP-Bench 上做了評估。結果顯示,EnvACE 的整體表現優於那些依賴擴充套件外部環境的基線方法,而且具備不錯的遷移能力。控制實驗還發現,世界排練在不同規模的模型上都能穩定地帶來策略提升,並不是只在特定引數量下才起作用。

更妙的是測試階段。因為世界模型已經被內化,智慧體在正式執行之前,可以先在內部做一輪私密排練(private rehearsal),預演一下結果。論文指出,在適度的排練預算下,這種做法能進一步帶來收益,而且全程不需要額外的外部互動。

這條路線為何值得關注

傳統的 agent 訓練高度依賴外部環境的質量和可得性。很多場景下,真實環境太貴、合成環境太難造,模擬器又不夠準。EnvACE 展示了一種可能性:把環境"裝進"模型引數裡,讓訓練過程從外部環境的約束中解放出來。

  • 減少對外部環境的依賴,降低訓練基礎設施的搭建成本
  • 訓練過程中無需執行真實工具呼叫,也降低了驗證環節的複雜度
  • 內部世界模型在推理階段可複用,帶來額外收益

當然,這不是說外部環境就沒用了。腦補出來的響應終歸是模型自己的想象,存在幻覺風險。論文目前的實驗集中在工具呼叫這類結構化任務上,能否推廣到更開放的物理世界互動,還有待觀察。不過,作為一條新路徑,世界排練確實給 agentic RL 的研究開啟了一個新的視窗。

想跟進的開發者可以做什麼

論文作者已經在 arXiv 上公開了程式碼(連結見摘要頁)。如果你正在做 工具呼叫智慧體 的訓練,或者對 agentic reinforcement learning 感興趣,可以拿自己的任務試試看。建議從 BFCL-v4 這類公開基準入手,先復現論文裡的結果,再觀察模型在你自己的工具集上能否保持同樣的腦補效果。

同時也要留意侷限:世界排練的效果很大程度上取決於模型對環境的先驗知識,如果工具行為太冷門,模型可能想象不出合理響應。這也是未來工作需要解決的核心問題之一。

EnvACE 的價值不在於否定傳統環境互動,而是提供了一條更輕量的補充路線。對獨立研究者和小團隊來說,這意味著不用堆大量環境資源,也能探索 agent 訓練的新玩法。

EnvACE世界排練Agentic RL大語言模型智慧體訓練工具呼叫強化學習科研論文長期工具呼叫智慧體

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

開源專案

Awesome AI for Science: 精選AI科學發現資源

這是一個精選AI工具、庫、論文、數據集和框架的倉庫,覆蓋物理、化學、生物學和材料科學。為研究人員和開發者提供快速掌握AI在科學探索中應用的價值資源。擁有超過1700顆星,採用MIT許可證。

earth2studio: NVIDIA 面向天氣與氣候的深度學習框架

earth2studio 是 NVIDIA 開源的一個深度學習框架,專為天氣和氣候領域設計。它簡化了從研究到部署的完整工作流,提供通用 API 和預訓練模型,幫助研究人員快速構建 AI 驅動的天氣預報和氣候模擬應用,降低開發門檻並加速領域創新。

ai4paper: 面向研究者的開源AI學術平臺

ai4paper是一個面向研究人員的開源AI平臺,聲稱可訪問2.4億篇學術論文。其核心功能包括全文PDF翻譯、AI驅動的文獻搜索和一鍵生成評論,通過網頁界面即可使用,無需安裝插件。該平臺還支持Zotero集成,並可通過小程序訂閱期刊,旨在提升文獻綜述和學術寫作的效率。項目主要使用HTML編寫,採用MIT許可證,截至採集時在GitHub上獲得2739個星標。

ResearchStudio: 微軟開源AI協作研究工具

ResearchStudio 是微軟發布的開源 AI 協作工具,旨在支持研究人員從問題提出到最終發表的完整學術旅程。它集成了文獻綜述、實驗設計、數據分析和論文寫作等功能,並利用大型語言模型提供智能建議。該項目特別適合希望優化工作流程的學術研究者。主要程式語言為 Python,採用 MIT 許可證,採集時 GitHub 星標數為 1911。

open-science: 本地優先的AI科研工作臺

open-science 是一個開源、本地優先、模型無關的 AI 研究工作臺,專為科學發現設計。它讓科研人員在自己的機器上執行 AI 輔助流程,不繫結特定模型,兼顧資料隱私與靈活性。