技术进展

李飞飞团队推出世界模型Atlas,锚定新视角预测

Heooo 09月07日23时00分 45 阅读

「李飞飞团队披露最新多模态世界模型Atlas,以“新视角预测”为核心原语,突破大语言模型和视频模型的范式局限,将生成与重建深度融合。仅需数张照片即可构建三维场景,大幅降低数据成本,有望成为通往通用人工智能的基础原语,并拓展创意、建筑、机器人等应用。」

近日,人工智能领域先驱李飞飞携World Labs核心团队做客a16z,首次全面披露了其团队最新研发的多模态世界模型Atlas。与大语言模型预测下一个token、视频模型预测下一帧的逻辑不同,Atlas将核心锚定在“新视角预测”上,展现出颠覆传统三维重建与内容生成的巨大潜力。

长期以来,大语言模型的核心在于预测下一个token,视频生成模型则聚焦于预测下一帧。相比之下,Atlas的精髓在于“新视角预测”。用户只需向系统输入场景的若干视角图像或相关文字描述,模型便能精准输出时空任意位置的画面。这一机制首次实现了“生成”与“重建”在同一个模型中的深度融合,能够原生处理文字、图像、视频、三维数据以及相机位姿等多模态信息。研发团队表示,新视角预测的重要地位完全可以与大语言模型的下一个token预测相提并论,极有可能是通往通用人工智能(AGI)的核心基础原语之一。

在传统三维重建领域,往往需要采集数百甚至上千张照片才能构建出一个完整场景,而Atlas彻底改变了这一行业痛点。它将数据采集量大幅压缩至区区几张或几十张。例如,仅凭三部iPhone拍摄的画面,就能直接生成类似电影特效一般的子弹时间视频。这种突破源于Atlas对前一代模型Marble的迭代升级。早期的Marble模型因采用高斯泼溅作为输出表示而面临技术瓶颈,Atlas则创新性地将新视角预测确立为基本原语,有效解决了传统三维重建容易出现盲区、必须依赖生成技术进行盲区补全的难题,同时具备高度可扩展的空间上下文窗口。

随着这一技术不断成熟,其应用落地场景正迅速向多个前沿方向延伸。在创意设计领域,Atlas能够为创作者提供高度三维一致的生成内容,大幅降低制作门槛与周期;在建筑与施工行业,其高精度的空间还原与预测能力可深度服务于工程设计各环节;在机器人领域,它能大幅提升现实环境到仿真测试的转化效率,有效缓解机器人训练长期面临的数据不足难题,未来还将无缝接入动态数据,进一步打通动作规划能力。

目前,Atlas已经具备初步的动态处理能力。研发团队透露,未来演进方向将重点聚焦于动态效果、内容编辑以及人机交互等维度,持续推动技术进步,最终目标是构建一个能够让普通用户与三维虚拟世界进行直观交互的完整系统。这意味着Atlas不仅是一套技术方案,更可能成为未来智能体理解与操作物理世界的重要基础。

# 世界模型 # 新视角预测 # 三维重建

来源:Heooo AI工具导航