<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Atlas on AI 实战派 · 从技术到赚钱</title><link>https://guijiagi.com/tags/atlas/</link><description>Recent content in Atlas on AI 实战派 · 从技术到赚钱</description><generator>Hugo</generator><language>zh-cn</language><copyright>本站内容采用 CC BY-NC-SA 4.0 国际许可协议授权</copyright><lastBuildDate>Mon, 14 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://guijiagi.com/tags/atlas/index.xml" rel="self" type="application/rss+xml"/><item><title>李飞飞World Labs Atlas世界模型：空间智能新纪元</title><link>https://guijiagi.com/posts/feifei-li-world-labs-atlas/</link><pubDate>Mon, 14 Sep 2026 10:00:00 +0800</pubDate><guid>https://guijiagi.com/posts/feifei-li-world-labs-atlas/</guid><description>&lt;h2 id="引子当ai开始理解空间">引子：当AI开始&amp;quot;理解空间&amp;quot;&lt;/h2>
&lt;p>2026年，李飞飞创办的World Labs发布了Atlas世界模型。这件事为什么重要？因为它标志着AI的能力边界，又一次被重新划开——&lt;strong>从&amp;quot;理解语言&amp;quot;，迈向&amp;quot;理解空间与物理世界&amp;quot;。&lt;/strong>&lt;/p>
&lt;p>李飞飞在AI界的地位无需赘述——ImageNet之父，深度学习革命的关键推手。她离开谷歌后创办World Labs，押注的方向就是&amp;quot;空间智能&amp;quot;：让AI不只看懂一张图，而是理解这个世界在三维空间里如何运作、物体如何移动、因果如何发生。Atlas，就是这个愿景的第一次大规模落地。&lt;/p>
&lt;h2 id="atlas是什么从几张照片到一分钟世界">Atlas是什么：从几张照片到一分钟世界&lt;/h2>
&lt;p>Atlas最打动人的能力，是它的输入输出规格。&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>项目&lt;/th>
&lt;th>Atlas世界模型&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>出品方&lt;/td>
&lt;td>World Labs（李飞飞）&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>类型&lt;/td>
&lt;td>多模态世界模型&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>输入&lt;/td>
&lt;td>1–6张照片&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>输出&lt;/td>
&lt;td>约1分钟、1440p分辨率视频&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>理解这个能力的震撼之处，要想清楚它做了什么：你随便扔给它1到6张照片，它不是简单地把照片拼成一段幻灯片，而是&lt;strong>在内部构建出一个可运转的三维世界&lt;/strong>，然后让镜头在这个世界里自由移动、让物体按物理逻辑运动，最终生成一段一分钟、1440p高清的连续视频。&lt;/p>
&lt;p>这和传统的&amp;quot;视频生成&amp;quot;有本质区别。普通视频生成模型是在像素层面&amp;quot;脑补&amp;quot;下一帧， Atlas则是在理解空间结构后&amp;quot;推演&amp;quot;一个世界。前者看起来像视频，后者看起来像&lt;strong>你真的走进了那个空间&lt;/strong>。&lt;/p>
&lt;blockquote>
&lt;p>数据来源：World Labs官方发布与演示，2026年&lt;/p>&lt;/blockquote>
&lt;h2 id="为什么世界模型是下一个浪潮">为什么&amp;quot;世界模型&amp;quot;是下一个浪潮&lt;/h2>
&lt;p>要理解Atlas的价值，得先理解为什么&amp;quot;世界模型&amp;quot;被认为是AGI的下一座山峰。&lt;/p>
&lt;p>语言模型解决的是&amp;quot;符号推理&amp;quot;——把世界压缩成文字来理解。但人类智能的底层，其实是对物理世界的直觉：东西会掉、墙会挡路、球会滚、镜头移动时物体会按透视关系变化。这种&amp;quot;物理直觉&amp;quot;，语言模型给不了。&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>智能类型&lt;/th>
&lt;th>代表能力&lt;/th>
&lt;th>代表模型&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>语言智能&lt;/td>
&lt;td>文本推理、对话&lt;/td>
&lt;td>GPT系列&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>视觉智能&lt;/td>
&lt;td>看图、识别&lt;/td>
&lt;td>多模态大模型&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>空间/世界智能&lt;/td>
&lt;td>理解三维、推演物理&lt;/td>
&lt;td>Atlas这类世界模型&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>世界模型的意义在于：它让AI第一次拥有了&amp;quot;在脑海里模拟世界&amp;quot;的能力。这不只是为了做酷炫的视频——这种模拟能力，恰恰是机器人、自动驾驶、仿真训练最需要的底层引擎。一个能在内部推演世界如何运转的模型，才能真正指导物理世界的行动。&lt;/p>
&lt;h2 id="从照片到世界技术上难在哪">从照片到世界：技术上难在哪&lt;/h2>
&lt;p>Atlas&amp;quot;1–6张照片生成一分钟世界&amp;quot;听起来简单，背后的技术难点却层层叠叠。&lt;/p>
&lt;p>&lt;strong>第一，三维重建与一致性。&lt;/strong> 给它几张不同角度的照片，模型必须在内部把它们重建成一个连贯的三维结构，保证镜头移动时墙面不穿帮、物体不畸变。这是几何与学习的结合。&lt;/p>
&lt;p>&lt;strong>第二，物理推演。&lt;/strong> 世界里的物体怎么动？重力怎么作用？光线怎么反射？Atlas必须学到某种&amp;quot;物理先验&amp;quot;，而不是随机抖动像素。&lt;/p>
&lt;p>&lt;strong>第三，时间一致性。&lt;/strong> 一分钟、1440p的视频，要保证每一帧之间空间关系稳定、光影连续、没有闪烁崩坏。这对长时序生成是极大考验。&lt;/p>
&lt;p>Atlas能把这三点串起来，说明它在&amp;quot;空间表征&amp;quot;这个方向上已经达到了实用化的临界点。&lt;/p>
&lt;h2 id="行业影响空间智能的外溢效应">行业影响：空间智能的外溢效应&lt;/h2>
&lt;p>Atlas的影响，会沿着几条线向外扩散。&lt;/p>
&lt;p>&lt;strong>第一，内容创作成本骤降。&lt;/strong> 过去要做一段有空间感的场景视频，需要3D建模、渲染、动画，成本高昂；现在几张照片就能生成。影视预演、游戏场景、虚拟空间的创作门槛会大幅下降。&lt;/p>
&lt;p>&lt;strong>第二，机器人与自动驾驶的仿真引擎。&lt;/strong> 这是World Labs真正的长远野心——用世界模型生成海量仿真训练数据，让机器人在&amp;quot;想象中的世界&amp;quot;里学会行动。这比在真实世界里一毫米一毫米地试，高效几个数量级。&lt;/p>
&lt;p>&lt;strong>第三，与具身智能合流。&lt;/strong> 当世界模型能理解空间物理，它就能给人形机器人这类具身智能提供&amp;quot;大脑级&amp;quot;的环境理解。Atlas不是孤立的视频工具，它是通向具身智能的一块垫脚石。&lt;/p>
&lt;h2 id="冷静的期待世界模型还在童年">冷静的期待：世界模型还在童年&lt;/h2>
&lt;p>当然，冷静地看，Atlas目前仍是&amp;quot;惊艳的早期作品&amp;quot;。&lt;/p>
&lt;p>一分钟1440p的视频虽好，但它生成的世界在长时间运行后，物理规律会不会崩？物体之间的复杂交互能不能稳定推演？从&amp;quot;生成一段好看的视频&amp;quot;到&amp;quot;作为可靠的仿真引擎驱动真实机器人&amp;quot;，中间还有很长的路要走。&lt;/p>
&lt;p>世界模型这个方向，注定是一个&amp;quot;越用越准&amp;quot;的领域——需要海量的三维数据、物理交互数据去喂养。Atlas开了个好头，但它更像是这一纪元的起点，而非终点。&lt;/p>
&lt;h2 id="结语ai开始拥有空间想象力">结语：AI开始拥有&amp;quot;空间想象力&amp;quot;&lt;/h2>
&lt;p>李飞飞的Atlas，让我们看到了一种全新的智能形态：AI不再只是读完了人类写的所有文字，它开始在自己的&amp;quot;脑海&amp;quot;里重建这个世界。&lt;/p>
&lt;p>1到6张照片、一分钟1440p、可自由移动的三维空间——这些数字背后，是一种比文本生成更深层的理解。当AI有了空间想象力，它能做的就不只是回答问题，而是&lt;strong>预演未来、模拟行动、在虚拟世界里试错&lt;/strong>。&lt;/p>
&lt;p>这恰恰是通向具身智能、通向AGI的关键一跃。接下来最值得盯的，是Atlas这类世界模型如何与机器人、自动驾驶这些具身场景深度结合——那才是空间智能真正释放价值的地方。&lt;/p>
&lt;p>更多关于世界模型与具身智能前沿的深度分析，请持续关注guijiagi.com。&lt;/p></description></item></channel></rss>