在最新版本中,Project Genie 与 Google Maps 的 Street View 数据库进行了连接,使模型能够基于真实地点生成虚拟环境。
实际体验大致是这样的:
随后,用户可以像在电子游戏中一样 在这个地点的 AI 版本中移动和探索。
由于环境是实时生成的,用户还可以重新设定条件,例如:
也就是说,同一个真实地点可以被 无限次“重新想象”。
与常见的图像或视频生成工具不同,Project Genie 更像一个 互动世界构建器。
目前的主要能力包括:
整体效果更接近 程序化生成的游戏关卡,而不是静态图片或视频片段。
Project Genie 目前仍是 Google Labs 的实验性原型。
已知的访问条件包括:
特别是 Street View 真实地点功能,目前主要集中在 美国地点,未来可能扩展到更多国家。
Project Genie 由 Google DeepMind 的 Genie 3 世界模型驱动。
与传统生成模型只输出图片或视频不同,Genie 生成的是 完整、可互动的环境。
其关键技术特点包括:
从技术原理上看,该系统会根据 之前生成的画面以及用户动作预测下一帧画面,类似语言模型预测下一个词的方式。
尽管演示效果令人印象深刻,但 Project Genie 仍然只是研究原型。
主要限制包括:
因此,目前更合理的定位是 早期研究系统,而不是成熟的模拟平台。
DeepMind 将 Genie 视为迈向更通用 AI 的重要一步,因为它能够 理解并模拟环境。
潜在应用场景包括:
世界模型可以通过提示直接生成可玩的场景,大幅减少游戏环境的人工设计成本。
通过 Street View 与真实地点结合,学生未来可能在互动环境中探索城市、历史地点或自然生态系统。
真实世界训练成本高且风险大,而 Genie 可以生成几乎无限的模拟环境,为机器人或 AI 智能体提供训练场。
目前的大多数生成式 AI 主要生成 文本、图像或视频。
而像 Genie 这样的世界模型,则开始生成 会随时间变化、能与用户互动的完整环境。
这种变化很重要,因为互动模拟可以支持:
Project Genie 仍处于早期阶段,但它展示了一种新的可能:未来 地图、游戏、虚拟仿真和 AI 训练环境,也许会逐渐融合在同一个 AI 平台之中。