大規模言語モデルのエージェントに長周期のツール呼び出しを学習させるのは、コストも手間もかかる作業です。一般的な方法は、実環境または合成の実行可能環境と繰り返しインタラクションさせることですが、こうした環境の構築と検証には高いコストがかかります。外部シミュレータを使う場合も、実際のシナリオとの整合が難しいことがあります。最近arXivに掲載されたEnvACEという論文は、まったく異なる視点を提案しています。エージェントを外部環境で試行錯誤させるのではなく、エージェント自身に環境の役割を演じさせるというアプローチです。
発想の転換:エージェント自身に環境を想像させる
EnvACEの中核となる概念はワールドリハーサル(world rehearsal)です。学習プロセスにおいて、ポリシーは外部環境が各ステップの操作に応答する必要はもはやありません。ツール呼び出しを生成した後、すぐに環境の役割を演じ、その呼び出しがどのような結果を引き起こすかを想像し、その「想像上の」応答に基づいて意思決定を続けます。アクターと環境という2つの役割が同じモデル内で交互に切り替わり、タスク成功報酬を用いてエンドツーエンドの共同最適化が行われます。
一見すると自問自答のようにも思えますが、重要なのは、このリハーサルを通じてポリシーが「アクションと環境応答」の法則をパラメータに直接内部化する点です。これはモデル内部にエージェント世界モデル











コメント
コメントはまだありません
最初のコメントを書きましょう