Google DeepMind 最近放出了一个很有意思的实验项目——Project Genie,目前只对美国地区的 Google AI Ultra 订阅者开放。你可以把它理解成一个由 AI 实时生成的、无限大的互动世界。听起来有点抽象?实际玩一下就能明白:你输入一段文字描述,比如“一片漂浮在云中的森林,有小溪和石桥”,几秒钟后,一个可交互的 3D 场景就会出现在浏览器里,你甚至能用 WASD 键在里面走动。
技术核心:游戏引擎与扩散模型的结合
Project Genie 不是简单的文本转 3D 模型。它背后是一个经过专门训练的世界模型,融合了 游戏引擎的物理规则 和 扩散模型的视觉生成能力。传统方法要么只能生成静态场景,要么需要大量手工建模。Genie 的做法是:用大量游戏视频数据训练一个基础模型,让它学会“世界应该怎么运转”——比如重力、碰撞、植被分布。然后在每次生成时,模型会结合用户提示,实时推断出下一帧的画面和可交互元素。
这种思路让 Genie 生成了真正“可玩”的环境:你可以推动石块、收集物品,甚至触发简单的机关。虽然目前生成的物体边界还比较模糊,物理反馈也有些延迟,但考虑到它是完全由神经网络实时驱动,已经相当惊人了。
使用体验:门槛极低,但限制不少
参与测试的门槛很低——只需要是 Google AI Ultra 月费订阅者(每月 19.99 美元),并在美国地区。打开网页后,你会看到一个类似聊天界面的输入框,输入任何场景描述即可。生成过程大约需要 10-20 秒,之后就能用鼠标键盘探索。
- 优点:无需任何 3D 建模技能,自然语言即可创造世界;场景无限大且持续生成;支持基础的物理交互。
- 缺点:目前只能生成自然环境(森林、沙漠、水下等),无法创建城市或复杂建筑;交互限于移动和基础物体操作;画质类似 2010 年左右的游戏;必须联网且仅限桌面浏览器。
实际影响:对哪类人值得关注?
对于 游戏独立开发者 和 教育工作者 来说,Project Genie 预示着一个未来:用自然语言快速搭建游戏原型或教学场景。尽管现在的版本还非常粗糙,但 DeepMind 将其定义为“研究原型”,下一步方向很可能是提升保真度和交互复杂度。如果你在关注 AI 辅助内容生产,这绝对是一个值得跟踪的项目。
不过也要泼点冷水:Google 经常发布实验项目后不了了之。Genie 目前没有公开的发布路线图,也没有商业化承诺。把它当做一次有趣的技术预览就好,别急着押注。
实用建议
- 想尝鲜的话:先检查自己是否是 Google AI Ultra 订阅者(体验无需额外付费),准备好一个清晰的场景描述,比如“日落时的沙漠,有仙人掌和绿洲”。
- 别期望成品级质量:Genie 的生成风格有点像素化,物理引擎也不完美,更适合快速灵感验证,而非直接产出最终素材。
- 关注后续迭代:如果 DeepMind 开放更复杂的场景生成(比如室内或机械结构),或者降低推理延迟,这可能会改变游戏原型制作的工作流。
总的来说,Project Genie 让我们瞥见了生成式 AI 的下一个前沿——不再是静态图片或视频,而是活生生的、可以进入的世界。虽然还很不成熟,但这个方向本身已经足够令人兴奋。











评论
暂无评论
成为第一个评论的人