训练大语言模型智能体去完成长周期的工具调用,一直是个烧钱又费力的活。常见的做法是让它跟真实环境或合成可执行环境反复交互,但这类环境的构建和验证成本很高;换用外部模拟器,又往往难以对齐真实场景。最近 arXiv 上出现一篇题为 EnvACE 的论文,提出了一个很不一样的角度:与其让智能体在外部环境里摸爬滚打,不如让它自己扮演环境。
换个思路:让智能体自己脑补环境
EnvACE 的核心概念叫 世界排练(world rehearsal)。训练过程里,策略不再需要外部环境来响应它的每一步操作,而是自己生成工具调用后,紧接着扮演环境的角色,想象出这次调用会引发什么结果,再基于这个"脑补"出来的响应继续决策。两个角色——行动者与环境——在同一个模型里交替切换,并用任务成功奖励做端到端联合优化。
听起来有点像自问自答,但关键在于:通过这种排练,策略把"动作-环境响应"的规律直接内部化到参数里,相当于在模型内部长出了一个智能体世界模型。这个模型不是用来做预测的辅助模块,而是直接参与决策。
在多个测试基准上表现如何
论文在 BFCL-v4、tau²-Bench、VitaBench 和 FinMCP-Bench 上做了评估。结果显示,EnvACE 的整体表现优于那些依赖扩展外部环境的基线方法,而且具备不错的迁移能力。控制实验还发现,世界排练在不同规模的模型上都能稳定地带来策略提升,并不是只在特定参数量下才起作用。
更妙的是测试阶段。因为世界模型已经被内化,智能体在正式执行之前,可以先在内部做一轮私密排练(private rehearsal),预演一下结果。论文指出,在适度的排练预算下,这种做法能进一步带来收益,而且全程不需要额外的外部交互。
这条路线为何值得关注
传统的 agent 训练高度依赖外部环境的质量和可得性。很多场景下,真实环境太贵、合成环境太难造,模拟器又不够准。EnvACE 展示了一种可能性:把环境"装进"模型参数里,让训练过程从外部环境的约束中解放出来。
- 减少对外部环境的依赖,降低训练基础设施的搭建成本
- 训练过程中无需执行真实工具调用,也降低了验证环节的复杂度
- 内部世界模型在推理阶段可复用,带来额外收益
当然,这不是说外部环境就没用了。脑补出来的响应终归是模型自己的想象,存在幻觉风险。论文目前的实验集中在工具调用这类结构化任务上,能否推广到更开放的物理世界交互,还有待观察。不过,作为一条新路径,世界排练确实给 agentic RL 的研究打开了一个新的窗口。
想跟进的开发者可以做什么
论文作者已经在 arXiv 上公开了代码(链接见摘要页)。如果你正在做 工具调用智能体 的训练,或者对 agentic reinforcement learning 感兴趣,可以拿自己的任务试试看。建议从 BFCL-v4 这类公开基准入手,先复现论文里的结果,再观察模型在你自己的工具集上能否保持同样的脑补效果。
同时也要留意局限:世界排练的效果很大程度上取决于模型对环境的先验知识,如果工具行为太冷门,模型可能想象不出合理响应。这也是未来工作需要解决的核心问题之一。
EnvACE 的价值不在于否定传统环境交互,而是提供了一条更轻量的补充路线。对独立研究者和小团队来说,这意味着不用堆大量环境资源,也能探索 agent 训练的新玩法。











评论
暂无评论
成为第一个评论的人