从ImageNet到世界模型:李飞飞的第二次革命
2026年9月2日,李飞飞创办的World Labs正式发布世界模型Atlas。
如果你记得李飞飞这个名字,大概率是因为ImageNet——那个在2012年点燃深度学习革命的图像数据集。14年后,她把战场从"看懂图片"转移到了"理解空间"。
数据来源:World Labs官方发布会,2026年9月2日
Atlas能做什么?
Atlas不是一个视频生成模型,它是一个世界模型——理解三维空间几何关系的模型。具体能力:
- 输入:文本、图像、视频、相机位姿、3D深度信息
- 输出:仅凭1-6张照片,合成最长1分钟、1440p分辨率的连贯运镜视频
- 核心能力:稀疏视角空间重建,大幅降低3D场景构建成本
数据来源:World Labs技术报告,2026年9月
为什么"1-6张照片"是关键指标?
传统的3D场景重建需要数百张甚至数千张照片,通过SfM(运动恢复结构)算法拼接而成。Atlas把这个数字降到了个位数。
这意味着什么?一个手机用户随手拍几张照片,AI就能在几秒钟内重建出可交互的3D场景。从房产展示到游戏关卡搭建,从工业巡检到AR导航——3D内容的生产成本直接被砍掉两个数量级。
盲测中的相机控制胜率
在第三方盲测中,Atlas的相机控制表现远超主流视频生成模型。具体来说,当测试者要求模型"从桌子左侧缓慢推进到桌面上的茶杯特写"时:
- Atlas能保持空间一致性,不会出现茶杯忽大忽小、桌面突然变形的问题
- 主流视频模型往往在第3秒后就开始"自由发挥",空间关系崩塌
数据来源:World Labs官方盲测报告,2026年9月
技术架构:多模态自回归扩散Transformer
Atlas的架构选择也很有特点——多模态自回归扩散Transformer。
这不是简单的"Transformer+扩散模型"拼接。它的创新在于:把文本token、图像token、视频token、相机位姿token、深度token统一编码到同一个Transformer的序列中,然后用自回归方式生成后续帧。
这种设计的好处是:模型真正理解了"相机在空间中移动"这个物理过程,而不是在像素层面做插值。这就是为什么Atlas生成的运镜视频在物理上是连贯的。
开源跟进:StereoWorld与国内布局
Atlas发布后一周,开源社区立刻跟进:
- VAST、港大、PICO联合开源双目世界模型StereoWorld
- 北京"双智城市"世界模型联合实验室正式揭牌
数据来源:StereoWorld GitHub仓库;北京市科学技术委员会公告
StereoWorld用双目视觉输入替代了Atlas的单目多视角输入,路线不同但目标一致——用AI理解三维空间。国内的"双智城市"实验室则把世界模型和智慧城市建设绑定,试图用AI重建城市级数字孪生。
物理AI/具身智能:投资人最关注的方向
Atlas的发布不是孤立事件。它标志着AI行业的投资重心正在从"数字世界的对话"转向"物理世界的行动"。
2026世界机器人大会发布了311款新品。宇树科技提出"物理AI机器人自进化“概念。中科创星是最早投资智元机器人的机构之一——现在回头看,这笔投资踩在了正确的时间点上。
数据来源:2026世界机器人大会官方数据;中科创星投资组合公告
为什么是现在?
三个条件同时成熟:
- 大模型:LLM提供了常识推理和任务规划能力
- 世界模型:Atlas这类模型提供了物理空间理解能力
- 机器人硬件:关节、传感器、算力模组成本持续下降
三者交汇,就是具身智能从Demo走向产品的窗口期。
对行业的影响
游戏与影视
用几张概念图生成1分钟连贯运镜视频,对预制作阶段的分镜设计来说是降维打击。游戏关卡设计师可以快速验证空间布局,导演可以快速预览镜头调度。
自动驾驶
世界模型的本质是"理解物理世界”。Atlas这类模型如果继续进化,理论上可以为自动驾驶提供一个低成本的仿真环境——不需要在真实道路上跑几十亿英里,直接在世界模型里做闭环测试。
智慧城市
北京"双智城市"实验室的方向是:用世界模型重建城市级数字孪生,用于交通模拟、灾害推演、城市规划。这个想象空间极大,但工程难度也极大。
结语:从"看图说话"到"在世界里行动"
李飞飞在发布会结尾说了一句话:“AI从语言走向视觉,从视觉走向空间。空间智能是下一个十年。”
Atlas的发布只是起点。真正的革命,不是AI能生成多炫的视频,而是AI开始理解它所处的物理空间。当AI能理解空间,它就能在空间中行动——这才是物理AI的真正含义。
更多世界模型与具身智能的深度技术解析,欢迎访问guijiagi.com,也可在硅基AGI论坛 silicon-agi.com参与前沿方向讨论。