产业 / 媒体
单一AI模型从少量照片生成、重建并模拟3D世界
World Labs是由AI研究者李飞飞联合创办的空间智能公司,近日发布了其首个大规模世界模型Atlas。该模型能够仅凭少量图片生成、重建并模拟三维场景,覆盖摄像机控制视频生成、多视角三维重建、点云与高斯泼溅输出,以及机器人仿真训练数据生成等多项能力。与现有多模态语言模型或视频扩散模型将输入处理为一维或二维序列不同,Atlas将所有输入锚定在三维空间坐标中,形成公司所称的「空间上下文」。在外部人类评估者的对比测试中,Atlas在摄像机引导生成任务上以75%至94%的胜率超越MiniMax H3、Gemini Omni Flash等多款专用模型;在三维重建任务上,其中位误差25.3也领先于Pi3X和VGGT-Ω 1B。Atlas目前通过早期访问计划向合作伙伴开放,未来将驱动公司旗下产品Marble的后续版本。
World Labs由李飞飞于2024年创立,她此前主导了ImageNet数据集的构建,并曾担任谷歌云AI部门负责人。公司自成立起便专注于「空间智能」这一核心目标——让AI像人类一样理解三维空间。Atlas是公司首个在该方向上实现规模化落地的模型,也是对李飞飞2025年11月公开论述的直接回应:现有架构将数据压缩为低维序列,导致即便是简单的空间任务也难以完成,真正需要的是在标记化、上下文与记忆层面具备三维乃至四维感知能力的新架构。
Atlas在架构上融合了语言模型与视频模型的核心思路。它像语言模型一样逐步生成输出,因此可以直接复用KV缓存等推理加速技术;同时引入扩散原理,从噪声中逐步精炼结果,并借助缩短去噪步骤或提升图像质量的相关方法。World Labs将这一设计称为「从零开始训练的全能模型」,训练数据涵盖文本、图像、视频与三维数据,所有输入均被锚定至三维空间中的具体位置。
在摄像机控制生成方面,Atlas接受一张或多张图像,并根据用户指定的摄像机路径——以几何输入而非文字描述的形式传入——生成对应视角的新画面,最高支持1440p分辨率、长达一分钟的视频输出。World Labs将这种精确控制比作「自己掌舵」,而非像许多视频模型那样「拉老虎机」碰运气。在外部人类评估中,Atlas对比MiniMax H3的胜率为75%,对比Seedance 2.5的胜率高达94%。
在三维重建方面,Atlas仅需一到数十张普通照片即可还原真实场景,无需专业采集设备。输入图像越多,模型依赖自身先验知识填补空白的比例越低;仅凭两三张图像,Atlas便能输出高保真结果,并在OpenWorldLib框架的对比测试中超越VGGT和InfiniteVGGT等专用模型——后者在摄像机大幅移动时普遍出现几何不一致与纹理模糊问题。演示中,模型从25张斯坦福大学主广场的地面照片逐步拼合出完整场景,并生成远高于校园的航拍视角。
在机器人应用场景中,Atlas充当真实到仿真的转换工具:它重建真实房间,并生成模拟机器人传感器沿路径所能感知的图像与深度数据,用户可通过替换物体、位置、光照或背景来批量生成多样化训练数据,无需在现实中逐一采集每种情形。这项能力的技术基础来自World Labs于2026年7月收购的初创公司SceniX。公司表示,基于该引擎在五个机器人平台上进行的测试中,控制模型在无人干预的情况下各自运行了一小时。
Atlas还支持将场景输出为点云和三维高斯泼溅等原生三维格式,而非仅限于图像或视频,这与公司现有产品Marble所采用的表示方式一致。此外,Atlas具备跟随复杂文本提示、渲染文字、生成不同视觉风格及360度全景图的能力,但World Labs表示文生图并非其核心定位。目前Atlas通过早期访问计划向特定合作伙伴开放,并将驱动Marble及其他产品的后续版本,公司预计随着训练算力的增加,模型性能将持续提升。
要点
- Atlas将所有输入锚定在三维空间坐标中,以「空间上下文」统一生成、重建与仿真三项能力,区别于现有将数据处理为低维序列的多模态或视频模型。
- 在摄像机控制生成任务中,Atlas对比多款专用模型的人类评估胜率介于75%至94%之间;在三维重建任务中,其中位误差25.3领先于Pi3X和VGGT-Ω 1B。
- Atlas可作为机器人真实到仿真的转换工具,从少量照片生成多样化传感器数据,支持在纯仿真环境中训练机器人控制模型,无需大规模真实场景采集。
- 模型融合语言模型的自回归生成与扩散模型的去噪机制,同时支持KV缓存等推理加速技术,并可输出点云、三维高斯泼溅等原生三维格式。
- Atlas目前处于早期访问阶段,将驱动World Labs旗下产品Marble的后续版本,公司预计随训练规模扩大性能将持续提升。
原始标题:World Labs unveils Atlas, a single AI model that generates, reconstructs, and simulates 3D worlds from just a few photos
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。