ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

李飞飞团队Atlas深度访谈(下):机器人、三维世界与未来路线图

李飞飞团队Atlas深度访谈(下):机器人、三维世界与未来路线图 机器人、三维世界与未来路线图 | 允朗视域物理AI(Physical AI)一直被视为人工智能的下一个浪潮,它使得AI从虚拟走向现实,从文本和图像走向能与三维世界交互的智能体。近日,知名风投机构a16z旗下频道专访了美国国家工程院院士、“AI教母”李飞飞领导的World Labs团队,就这一前沿方向展开了深度对话。在采访中,World Labs团队首次详细解读了其最新推出的多模态世界大模型Atlas,并表示AI 不应只依赖语言模型,更应具备‌空间智能‌,让机器理解物理世界,还提出了“新视角预测”(New View Prediction)。他们认为,“新视角预测”的重要性堪比大语言模型中的“下一词预测”(Next Token Prediction),如果说后者教会了AI“接话”,那么前者正在教会AI“环顾四周”和“理解纵深”。这一方向的提出,也意味着物理AI正从感知世界迈向推理世界,从被动识别走向主动理解空间关系与物体交互。PART FOUR“Atlas是实现空间智能的第一步”04世界模型是什么?简单说,大语言模型学的是文本的统计规律,根据前文猜下一个词。世界模型学的则是时空的统计规律,即理解三维空间如何构成、物体如何运动、场景如何变化。二者的本质区别在于,大语言模型处理的是符号,世界模型处理的是物理世界本身的结构。这也是李飞飞一贯的核心主张:“如果AI没有空间智能,就不可能真正实现AGI。”李飞飞认为空间智能能够构建空间、推理,还能编辑和交互,加上时间就是4D,但起码得先搞定3D,理解几何、结构和物理特性,这是基础。2026年6月,李飞飞在长文《世界模型的功能分类法》中将世界模型划分为三层:渲染器、模型器和规划器。渲染器主要是输出画面,回答“看起来像什么”;模拟器是输出可计算的世界状态,涉及几何、物理与动力学等;规划器则回答“下一步该做什么”。
返回列表