李飞飞World Labs发布Atlas:全球首个多模态世界模型,可像素级控镜并重建3D
李飞飞创立的World Labs于9月2日发布自称全球首个的多模态世界模型Atlas,支持像素级相机控制生成图像视频、3D重建与时空模拟,官方称可为视觉特效与机器人训练打开大门。
今早,一段“李飞飞在办公室里叠衣服”的视频在AI圈刷屏:画面里的女士神态与动作几可乱真。据机器之心报道,李飞飞本人转发这段由模型生成的画面时开玩笑说:“我们办公室里确实真的在叠衣服!”生成它的,正是这位“AI教母”创办的World Labs于美国当地时间9月1日(9月2日经中文媒体集中报道)发布的新一代世界模型Atlas。

一个模型,四种“世界语言”
据科创板日报9月2日报道,World Labs将Atlas称作“全球首个多模态世界模型”,宣称它能以像素级精确的相机控制生成图像和视频帧,并将其在3D中重建。按官方博客的定义,Atlas是一款面向空间智能的全模态(omni)世界模型,从零开始预训练,原生处理文本、图像、视频与3D四种数据。
它的能力被官方拆成四块:相机控制生成——从一张或多张参考图输出最长1分钟、1440p分辨率的视频;空间重建——从一到数十张输入图还原真实场景,并输出点云、3D高斯泼溅等显式3D结果;时空模拟——把已有视频重新构图、换机位,并支撑机器人的Real-to-Sim流程;图像生成——包括文生图与360°全景图。
把相机几何写进“原生语言”
Atlas最特别之处,在于把相机位姿当作原生输入类型,而非靠文字提示词描述运镜。据机器之心报道,官方形容这让创作者“坐进导演椅,而不是在拉老虎机的拉杆”。只拍到机器人正面的照片,模型能“脑补”出它的背面;一张泳池边角照之外,它会按“世界常识”补出草坪与远山。
空间重建给出的案例更有冲击力:据36氪(爱范儿授权发布)报道,官方仅用2到25张斯坦福大学主方庭的地面平拍照,就还原出草坪、拱廊与纪念教堂外墙,还能生成远高于校园上空的航拍漫游路径。官方称通常两三张图即可给出忠实重建,也能吃下超过一百张输入图。
架构上,Atlas是一个多模态自回归扩散Transformer:文本、图像、相机位姿与深度图被共同“锚定”进三维空间,形成官方所称的“空间上下文”。据量子位报道,这套混合LLM与视频模型思路的设计,能同时吃到KV缓存、分布式推理等LLM侧加速,以及扩散蒸馏、无分类器引导等视频模型算法。
战绩与留白
定量评测上,官方交出两块成绩。据机器之心报道,在相机控制生成的第三方盲测中,Atlas对MiniMax H3的胜率为75%、对Gemini Omni Flash为81%、对阿里HappyHorse 1.1为86%、对FLUX 3为93%、对字节Seedance 2.5为94%,且运镜轨迹越复杂优势越大。在稀疏视角3D重建上,其平均误差(AbsRel×10⁻³)为25.3,低于Pi3X(28.7)、Depth Anything 3(39.3)等专业开源重建模型。
不过留白也很明显。机器之心的报道特别指出:对比模型不接受相机位姿作为原生输入、只能用文本描述运镜,因此75%到94%衡量的很大程度是“原生相机接口”对“文本描述运镜”的差距,并非画面质量全面碾压;重建对比也被限定为“最好的开源专用模型”,并非每个数据集都排第一。官方尚未公布参数量、训练数据规模、scaling曲线与推理成本。36氪则提醒,镜头一旦进入原图未拍到的区域,模型仍需靠先验“猜”,视角跨度越大、路径越长,越容易出现几何漂移与纹理闪烁。
奔着机器人去的“星辰大海”
李飞飞的高徒、英伟达机器人研究主管Jim Fan在转发中评价,这是机器人领域Real-to-Sim的一大步(据量子位)。把Atlas放回World Labs的时间线,这步棋的指向更清晰:据机器之心梳理,公司2024年9月带2.3亿美元融资走出隐身模式,2025年11月推出首款产品Marble,2026年2月完成10亿美元新融资、估值约50亿美元,7月收购机器人仿真公司SceniX。彼时,李飞飞刚在6月把世界模型分为渲染器、模拟器、规划器三类,并强调“最关键的是模拟器”(据量子位)。
官方演示里,用手机拍两段各取24帧的厂房视频即可重建环境,再由Atlas生成机器人机身相机沿路径应看到的RGB与深度数据,低成本批量制造训练场景。36氪援引业内估算称,若完全靠传统方式收集足量机器人训练数据,成本或高达100万亿美元量级——这正是Atlas“以生成换训练场”的叙事张力所在。
目前Atlas不开源,仅向部分合作伙伴开放早期访问,并可在官网申请,未来将成为Marble及World Labs其他产品的底层模型(据机器之心)。站长之家则援引官方说法称,未来几周将逐步向更广泛的早期访问者开放。至于“全球首个”的头衔能否经得起真实场景的独立检验,答案还在路上。

信息来源
信息来源:科创板日报