技术进展

李飞飞发布多模态世界模型Atlas

Heooo 09月02日11时34分 3 阅读

「李飞飞创企World Labs发布全球首个多模态世界模型Atlas,支持像素级精度的相机控制,可生成图像视频并重建3D场景,实现子弹时间效果,输出最长1分钟1440p视频,开放早期访问。」

世界模型赛道迎来重磅玩家。由“AI教母”李飞飞创立的World Labs正式发布Atlas,宣称这是全球首个多模态世界模型。该模型的核心突破在于能够以像素级精确的相机控制生成图像和视频帧,并将这些输出在3D空间中进行重建,为内容创作和智能模拟提供了全新工具。

Atlas在架构上采用了从头开始的预训练策略,使其天然支持多模态输入,包括相机移动指令。与传统的生成模型只输出平面像素不同,Atlas会将多个输入视图在空间上下文中进行定位,从而允许用户在生成过程中精确控制视角和轨迹。这种设计不仅让输出更加一致,也使得用户可以实现类似电影工业中“子弹时间”的摄影效果,自由地绕场景旋转视角,获得极具冲击力的视觉体验。

在功能层面,Atlas覆盖了世界生成、重建和模拟三大类任务。在相机控制生成方面,它能够从一张或多张参考图像生成对应的图像和视频,最长可输出1分钟的1440p高分辨率视频,并且保持几何一致性。在空间重建方面,Atlas可以处理从单张到数十张输入图像的真实场景,既能从新颖视角生成图像帧,也能直接输出显式三维模型,其精度甚至超越了专门用于3D重建的先进开源模型。在时空模拟方面,Atlas通过输入视频同时建模空间和时间维度,能够重新构图既有视频以增强戏剧性,还可支持机器人的真实到模拟工作流程,为具身智能研究提供基础能力。

此外,Atlas还具备强大的图像生成能力,支持从文本直接生成图像和360度全景图,可以跟随复杂提示词,渲染文本内容并呈现多种视觉风格。World Labs表示,部分合作伙伴已经获得Atlas的抢先体验资格,并将在未来几周内开放早期访问,届时更多开发者将有机会测试这一模型的实际能力。

Atlas的发布标志着生成式AI从“内容生成”向“世界模拟”迈出关键一步。当模型能够准确理解空间结构和物理规律,其应用边界将远超当前的图像与视频生成工具,有望在影视制作、游戏开发、自动驾驶仿真和机器人训练等领域带来根本性变革。世界模型的概念正在从学术研究走向产业化落地的起点。

# Atlas # 世界模型 # 李飞飞

来源:Heooo AI工具导航