技术进展

多模态世界模型Atlas实现像素级镜头控制

Heooo 09月03日07时01分 4 阅读

「World Labs正式发布全球首个多模态世界模型Atlas,支持像素级精确相机控制,可从单张或多张图像生成最长1分钟的1440p高清视频,并输出显式3D模型。该模型在空间重建上超越多个顶级开源重建模型,还能进行时空模拟,为机器人仿真及复杂场景生成提供支持。」

由“AI教母”李飞飞创办的World Labs近日发布了备受瞩目的多模态世界模型——Atlas。作为全球首个此类模型,Atlas的核心理念在于将视觉生成从二维平面推进到具备空间一致性的三维世界,用户不再只能被动接受模型输出的画面,而是可以通过精确的相机控制与场景进行交互。

Atlas最引人注目的能力是其像素级的相机控制。传统生成模型虽然也能输出视频,但往往难以精确指定镜头的运动轨迹与视角变化。Atlas则能够根据用户指定的任意摄像机位置和角度,生成与原始内容及几何形状完美匹配的参考图像,并平滑扩展画面,甚至自主补全输入中不可见的场景细节。这一机制让创作者可以轻松实现好莱坞大片中常见的“子弹时间”效果——时光仿佛凝固,视角却可自由旋转,整体视觉张力大幅提升。

在技术实现上,Atlas并非基于现有模型的微调,而是从头开始进行预训练的全新架构。它能够无缝接受包括相机移动在内的多模态输入,并将其转化为立体的三维视图。通过在模型的空间上下文中精准定位多个输入视图,Atlas可以在三维空间中构建一致的场景表达,从而实现对图像和视频帧的绝对控制。这种设计让它能够生成与原始内容和几何形状高度匹配的图像,并能从单张或多张输入图像中直接输出明确的3D模型。

官方介绍显示,Atlas在重建效果上已超越目前许多顶级的开源重建模型。它不仅能从数十张输入图像中重建真实场景,还能从新颖视角生成图像帧以及显式三维输出。这样强大的空间理解能力使其应用范围不仅限于内容创作,还可拓展至机器人的真实到模拟工作流程,为具身智能研究提供高质量的环境模拟基础。

除了空间重建与生成,Atlas还支持时空模拟功能。用户输入一段视频后,模型可以对视频中的空间与时间关系进行建模,进而重新构图视频以增强戏剧性视觉效果。这意味着模型能够理解动态场景中物体与镜头的相对运动,从而在时间维度上提供更多创作自由度。对于需要多视角一致性和场景动态变化的应用场景,Atlas展现出了极大的潜力。

在生成能力方面,Atlas同样覆盖了文本到图像与360度全景生成。它能够精准跟随复杂的提示词,渲染文字并呈现多种多变的视觉风格。官方表示,目前部分合作伙伴已获得该模型的抢先体验资格,并计划在未来几周内逐步向更广泛的早期访问者开放。随着越来越多开发者进入这一生态,Atlas有望为电影制作、游戏开发、仿真训练以及AI内容创作等领域带来全新范式。

# World Labs # Atlas # 世界模型

来源:Heooo AI工具导航