编译/VR陀螺
World Labs日前正式发布新一代世界模型Atlas,可基于单张或多张输入图像生成带精准相机控制的图视频,同时完成三维场景重建、时空模拟等复杂任务,标志着空间智能领域从2D生成向3D可控生成的重要升级。

据官方介绍,Atlas是从零开始预训练的多模态自回归扩散变换器,原生支持文本、图像、视频、相机姿态、3D深度图等多种数据类型。所有输入都会被映射到统一的“空间上下文”中,模型在此基础上生成后续内容,且全程保持与已有内容在三维空间中的一致性。
Atlas核心覆盖四大功能场景。 其一为相机可控生成。用户可自由指定相机位置与角度,基于参考图生成全新视角画面,最高支持输出一分钟时长、1440p分辨率的视频。和依赖文本描述相机运动的同类模型不同,Atlas直接将精确的相机几何参数作为原生输入,控制精度达到像素级别。
其二为空间重建。仅需1张到数十张输入图像,模型就能还原现实场景,输出新视角画面与显性3D成果。在DTU、ETH3D、KITTI等七个标准3D数据集测试中,Atlas的平均绝对相对误差为8.6,表现优于Pi3X、Depth Anything 3等专门的3D重建模型。 模型支持输出点云、3D高斯泼溅格式,即便是手机拍摄的普通视频,也能逐帧预测深度并拼接成完整三维场景,自动补全未拍摄到的盲区。
其三为时空模拟。只需3到5台普通手机或运动相机拍摄的素材,Atlas就能重构出“子弹时间”效果的多视角画面,实现视频的自由重新取景。 除此之外,Atlas也具备常规图像生成能力,可响应复杂文本提示生成图像与360度全景图,适配多种视觉风格。
性能方面,World Labs指出Atlas的效果会随训练算力提升持续增强。在相机可控生成任务的人类偏好评测中,Atlas对比MiniMax H3、Gemini Omni Flash、FLUX 3等主流模型,拿到了75%至94%的偏好率。
目前Atlas处于早期访问阶段,仅向部分合作伙伴开放。后续该模型将整合进World Labs旗下产品Marble的后续版本,开发者可通过官方渠道申请试用。官方表示,Atlas的目标是成为可生成、重建、模拟任意世界的通用模型,推动空间智能在创意设计、虚拟现实等领域的实际落地。
来源:worldlabs










