李飞飞团队推出世界模型 Atlas,或成通往 AGI 的核心原语
李飞飞团队联合 World Labs 在 a16z 首次披露多模态世界模型 Atlas,以“新视角预测”为核心,仅需少量图像即可实现三维重建与生成,应用覆盖创意、建筑与机器人等领域,或成通往 AGI 的核心原语之一。
发布时间:2026/09/08 03:59|分类:人工智能
近日,李飞飞携 World Labs 核心团队做客 a16z,首次全面披露多模态世界模型 Atlas。与大语言模型预测下一个 token、视频模型预测下一帧不同,Atlas 将核心锚定在“新视角预测”上。用户输入场景若干视角图像或文字描述,模型即可精准输出时空任意位置的画面。该机制首次在同一模型中深度融合“生成”与“重建”,原生处理文字、图像、视频、3D 及相机位姿等多模态数据。团队认为,新视角预测或成为通往 AGI 的核心基础原语之一。 传统 3D 重建通常需要数百甚至上千张照片,Atlas 将数据采集量压缩至几张或几十张。例如,仅凭三部 iPhone 拍摄的画面,就能直接生成电影特效般的子弹时间视频。Atlas 是对前一代模型 Marble 的迭代升级,解决了传统 3D 重建盲区补全难题,并具备可扩展的空间上下文窗口。 应用前景方面,Atlas 可服务创意设计、建筑与施工,以及在机器人领域提升现实到仿真测试的转化效率,缓解机器人训练数据不足问题。目前 Atlas 已具备初步动态处理能力,未来将重点推进动态效果、内容编辑和人机交互,构建普通用户可与 3D 虚拟世界直观交互的系统。