Valerant:用世界模型自动生成可导航的3D游戏地图

Valerant将视频预测与SLAM结合,无需重新训练即可从单张图像自动构建可导航的3D游戏地图。
论文提出的Valerant框架针对游戏领域世界动作模型研究的空白:现有方法多停留在2D像素预测,无法生成真正可导航的三维空间。Valerant以免训练方式组合三大模块——动作条件视频推演负责预测画面、SLAM技术将预测帧转化为三维几何结构、探索驱动策略引导地图持续扩张——从而将单张图像逐步扩展为持久的3D游戏地图。该框架在方法论上将世界模型的职责从"预测像素"升级为"构建可用空间",在应用层面则为游戏关卡的自动化生成提供了新思路。作为预印本,其在预测累积误差和地图几何精度方面的实用性仍有待验证。
从视频预测到可导航的3D世界
世界动作模型(World Action Models, WAMs)近年来在具身智能领域快速崛起。它的核心思想是将"预测性世界建模"与"动作生成"耦合起来——模型不仅能预测环境接下来会变成什么样,还能据此指导智能体做出下一步动作。这种"先想象、后行动"的范式,让机器人和自动驾驶系统能够在心中"预演"未来,从而做出更合理的决策。
然而,一篇新发布的 arXiv 论文(arXiv:2609.09418)指出:尽管世界动作模型在具身AI中进展迅猛,在游戏领域的通用化应用却几乎是一片空白。现有的游戏导向方法大多把动作条件世界模型与外部策略、奖励函数拼接起来,勉强实现类似 WAM 的决策能力,但它们几乎都停留在2D视觉观测空间,无法构建出持久存在的三维几何结构。

研究团队提出的 Valerant 框架,正是瞄准了这一空白:它试图把一个预训练的动作条件世界模型,改造成能够探索并构建3D游戏地图的完整系统。
游戏世界与现实世界的根本差异
论文敏锐地抓住了一个此前被忽视的关键问题:游戏世界没有"外部基底"。
在自动驾驶和机器人场景中,物理环境是独立于模型而存在的。无论模型如何预测,真实世界始终提供着一个持久的三维空间,选定的动作可以在其中被真实执行。换句话说,模型只需要"理解"世界,世界本身已经在那里。
虚拟世界必须被"实例化"
但游戏完全不同。虚拟世界本身需要被创造出来。大多数可玩的游戏都要求一个持久且可导航的空间,而3D游戏还额外要求显式的几何结构——只有这样,角色才能真正在其中移动、交互。
这里就产生了一个技术断层:动作条件视频推演(action-conditioned video rollouts)能够生成连续的视觉画面,但它提供的只是"看起来像"的图像序列,并不包含真正可供导航的空间表征。你可以让模型"想象"出一段游戏画面,却无法让角色在这段画面里真正走动、碰撞、探索。Valerant 要解决的核心问题,正是如何从视觉推演中"提炼"出可用的三维几何。
Valerant 的核心机制:三大模块协同
Valerant 最引人注目的一点是它是一个免训练(training-free)框架。它并不需要重新训练一个庞大的模型,而是巧妙地组合了三个已有的能力模块,让它们协同工作。
预测性视觉推演
借助预训练的动作条件世界模型,Valerant 能够根据给定动作预测出后续的视觉画面。这相当于让模型"设想"如果角色朝某个方向移动,画面会变成什么样。
基于 SLAM 的三维空间重建
单纯的视觉预测不足以支撑导航,因此 Valerant 引入了 SLAM(同步定位与地图构建) 技术。SLAM 在机器人领域已相当成熟,它能从连续的视觉观测中反推出三维几何结构和相机位姿。通过这一步,那些原本"虚幻"的预测画面被转化为持久的三维空间表征。
探索驱动的动作选择策略
最后,Valerant 采用探索驱动的策略来决定下一步该往哪里走。它会主动选择那些能够拓展未知区域、完善地图的动作,从而让3D地图不断"生长"。
通过这三大模块的耦合,Valerant 能够从单张图像出发,逐步将其扩展、构建成一张完整、持久、可导航的3D游戏地图。
Valerant 的意义与潜在影响
Valerant 的价值主要体现在两个层面。
在方法论层面,它把世界动作模型的交互范式从2D视觉仿真推进到了3D空间构建。以往的世界模型更多是"预测像素",而 Valerant 让世界模型第一次真正承担起"构建可用空间"的职责。这是 WAM 应用边界的一次实质性扩展。
在游戏开发层面,它为3D游戏地图创作提供了一条降低人工成本的新路径。传统游戏地图的设计与建模是一项极其耗费人力的工作,需要美术、关卡设计师反复打磨。如果能够以一张概念图或参考图为起点,让模型自动探索并生成可导航的三维场景,将极大提升开发效率,尤其对独立开发者和快速原型制作具有吸引力。
仍需审视的局限性
作为一篇刚发布的预印本论文,Valerant 仍有诸多问题有待验证:
- SLAM 重建在纯预测画面(而非真实观测)上的精度表现如何?
- 世界模型预测的累积误差会不会导致地图出现"漂移"或崩坏?
- 生成的地图在游戏可玩性和几何合理性上能否达到实用标准?
这些都需要更多实验和后续工作来回答。
但无论如何,Valerant 提出的思路——把世界模型从"想象画面"升级为"构建世界"——代表了一个值得关注的研究方向。它提醒我们,生成式AI在游戏领域的想象力,或许远不止于生成一段可玩的画面,而在于自动化地搭建起整个可交互的虚拟空间本身。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。