EnvACE: 用世界排练训练长期工具调用 Agent

EnvACE: 用世界排练训练长期工具调用 Agent

Grace Sullivan
145
original

EnvACE 提出世界排练方法,让大语言模型智能体在训练中自己扮演环境,内部化环境动态,减少对外部模拟器的依赖。在 BFCL-v4、tau²-Bench 等基准上超越环境扩展基线,测试阶段还能进行私密排练,为长期工具调用 agent 训练提供新路径。

训练大语言模型智能体去完成长周期的工具调用,一直是个烧钱又费力的活。常见的做法是让它跟真实环境或合成可执行环境反复交互,但这类环境的构建和验证成本很高;换用外部模拟器,又往往难以对齐真实场景。最近 arXiv 上出现一篇题为 EnvACE 的论文,提出了一个很不一样的角度:与其让智能体在外部环境里摸爬滚打,不如让它自己扮演环境。

换个思路:让智能体自己脑补环境

EnvACE 的核心概念叫 世界排练(world rehearsal)。训练过程里,策略不再需要外部环境来响应它的每一步操作,而是自己生成工具调用后,紧接着扮演环境的角色,想象出这次调用会引发什么结果,再基于这个"脑补"出来的响应继续决策。两个角色——行动者与环境——在同一个模型里交替切换,并用任务成功奖励做端到端联合优化。

听起来有点像自问自答,但关键在于:通过这种排练,策略把"动作-环境响应"的规律直接内部化到参数里,相当于在模型内部长出了一个智能体世界模型。这个模型不是用来做预测的辅助模块,而是直接参与决策。

在多个测试基准上表现如何

论文在 BFCL-v4tau²-BenchVitaBenchFinMCP-Bench 上做了评估。结果显示,EnvACE 的整体表现优于那些依赖扩展外部环境的基线方法,而且具备不错的迁移能力。控制实验还发现,世界排练在不同规模的模型上都能稳定地带来策略提升,并不是只在特定参数量下才起作用。

更妙的是测试阶段。因为世界模型已经被内化,智能体在正式执行之前,可以先在内部做一轮私密排练(private rehearsal),预演一下结果。论文指出,在适度的排练预算下,这种做法能进一步带来收益,而且全程不需要额外的外部交互。

这条路线为何值得关注

传统的 agent 训练高度依赖外部环境的质量和可得性。很多场景下,真实环境太贵、合成环境太难造,模拟器又不够准。EnvACE 展示了一种可能性:把环境"装进"模型参数里,让训练过程从外部环境的约束中解放出来。

  • 减少对外部环境的依赖,降低训练基础设施的搭建成本
  • 训练过程中无需执行真实工具调用,也降低了验证环节的复杂度
  • 内部世界模型在推理阶段可复用,带来额外收益

当然,这不是说外部环境就没用了。脑补出来的响应终归是模型自己的想象,存在幻觉风险。论文目前的实验集中在工具调用这类结构化任务上,能否推广到更开放的物理世界交互,还有待观察。不过,作为一条新路径,世界排练确实给 agentic RL 的研究打开了一个新的窗口。

想跟进的开发者可以做什么

论文作者已经在 arXiv 上公开了代码(链接见摘要页)。如果你正在做 工具调用智能体 的训练,或者对 agentic reinforcement learning 感兴趣,可以拿自己的任务试试看。建议从 BFCL-v4 这类公开基准入手,先复现论文里的结果,再观察模型在你自己的工具集上能否保持同样的脑补效果。

同时也要留意局限:世界排练的效果很大程度上取决于模型对环境的先验知识,如果工具行为太冷门,模型可能想象不出合理响应。这也是未来工作需要解决的核心问题之一。

EnvACE 的价值不在于否定传统环境交互,而是提供了一条更轻量的补充路线。对独立研究者和小团队来说,这意味着不用堆大量环境资源,也能探索 agent 训练的新玩法。

EnvACE世界排练Agentic RL大语言模型智能体训练工具调用强化学习科研论文长期工具调用智能体

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

开源项目

Awesome AI for Science:精选 AI 科学发现资源

这是一个精选 AI 工具、库、论文、数据集和框架的仓库,覆盖物理、化学、生物学和材料科学。为研究人员和开发者提供快速掌握 AI 在科学探索中应用的价值资源。拥有超过1700颗星,采用 MIT 许可证。

earth2studio: NVIDIA 面向天气与气候的深度学习框架

earth2studio 是 NVIDIA 开源的一个深度学习框架,专为天气和气候领域设计。它简化了从研究到部署的完整工作流,提供通用 API 和预训练模型,帮助研究人员快速构建 AI 驱动的天气预报和气候模拟应用,降低开发门槛并加速领域创新。

ai4paper:面向研究者的开源 AI 学术平台

ai4paper 是一个面向研究人员的开源 AI 平台,声称可访问2.4亿篇学术论文。其核心功能包括全文 PDF 翻译、AI 驱动的文献搜索和一键生成评论,通过网页界面即可使用,无需安装插件。该平台还支持 Zotero 集成,并可通过小程序订阅期刊,旨在提升文献综述和学术写作的效率。项目主要使用 HTML 编写,采用 MIT 许可证,截至采集时在 GitHub 上获得2739个星标。

ResearchStudio:微软开源 AI 协作研究工具

ResearchStudio 是微软发布的开源 AI 协作工具,旨在支持研究人员从问题提出到最终发表的完整学术旅程。它集成了文献综述、实验设计、数据分析和论文写作等功能,并利用大型语言模型提供智能建议。该项目特别适合希望优化工作流程的学术研究者。主要编程语言为 Python,采用 MIT 许可证,采集时 GitHub 星标数为 1911。

open-science: 本地优先的AI科研工作台

open-science 是一个开源、本地优先、模型无关的 AI 研究工作台,专为科学发现设计。它让科研人员在自己的机器上运行 AI 辅助流程,不绑定特定模型,兼顾数据隐私与灵活性。