李飞飞一声不响买下机器人公司!World Labs不再只“画世界”,空间智能杀入具身智能腹地
2026年7月21日一个普通的周一。但AI圈被一条消息炸了锅。李飞飞在她的社交平台上写下一句话“世界不止由文字组成。”这句看似平淡的宣言背后是一场足以改写空间智能赛道格局的收购——她创办的World Labs正式宣布收购机器人仿真初创公司SceniX。如果你对这个名字感到陌生不要紧。SceniX是一家成立于2024年的公司团队只有10个人总部在纽约。而World Labs估值已经冲到50亿美元背后的投资方包括英伟达、AMD、Autodesk这样的产业巨头。这是一场体量悬殊到近乎荒诞的“联姻”——50亿估值的大象吞下了一只10人团队的小虾米。但如果你稍微了解李飞飞的做事风格就会明白她从来不会做没有深意的事情。李飞飞是谁斯坦福大学计算机系教授、前谷歌AI首席科学家、ImageNet的缔造者。在AI圈她有一个独一无二的称号——“AI教母”。这个称号不是媒体炒作出来的而是整个学界对她二十多年贡献的认可。2009年她主导创建的ImageNet数据集拥有超过1400万张标注图像直接催生了深度学习在计算机视觉领域的爆发。2015年她发起AI4ALL公益项目致力于让更多女性和少数族裔进入AI领域。2017年到2018年她在谷歌云担任AI/ML首席科学家。2024年她离开斯坦福的教职创立了World Labs目标只有一个让AI理解三维世界。World Labs的官方博客里有一段话我反复读了三遍“机器人技术是空间智能走向物理现实的载体。我们相信机器人领域的下一次突破将融合空间智能、世界模型、学习驱动仿真同时打通与现实世界学习联动的闭环。”这段话的信息密度极高。它意味着World Labs的战略已经发生了根本性转变——从“让AI看世界”变成“让AI在世界中行动”。要理解这次收购的意义得先搞清楚World Labs到底在做什么。2024年9月World Labs成立首轮融资就拿了2.3亿美元。2025年11月它推出了第一款商用产品——世界模型Marble。你可以把Marble想象成一个“世界生成器”给它一张照片、一段视频或者一段文字描述它就能生成一个高保真、持久的三维世界。这个世界不是静态的壁纸而是可以交互、可以探索、可以编辑的完整空间。2026年2月World Labs又拿了10亿美元新一轮融资估值从10亿飙到50亿。英伟达、AMD、Autodesk等产业巨头纷纷入局。这些公司的名字本身就是答案——英伟达提供算力AMD提供芯片Autodesk提供三维设计工具。这是一条从硬件到软件到应用的完整产业链。但Marble有一个致命的问题它只能“画”世界却不能让AI“走进”这个世界。就像一个画家画了一幅栩栩如生的房间但画中人永远无法走出画框去触碰房间里的桌椅、花瓶、窗帘。这就是World Labs需要SceniX的原因。SceniX的核心技术是什么简单说就是一套高保真混合仿真平台让机器人在虚拟环境中完成操作、移动和交互训练然后把学到的技能无缝迁移到真实世界。这个技术听起来简单做起来极难。因为仿真和现实之间有一道巨大的鸿沟——在电脑里完美抓取一个杯子的机器人放到真实世界可能连杯子都碰不到。这个鸿沟学术界叫它“Sim-to-Real Gap”是整个机器人领域最头疼的难题之一。SceniX解决这个难题的方式可以用三个关键词概括高精度接触建模、多模态传感融合、随机化训练机制。“高精度接触建模”是什么意思绝大多数仿真平台依赖的是刚体物理引擎对软硬材质的接触形变、粘滞与滑移往往采用简化的经验公式。这就导致机器人在仿真中能完美抓取的东西到现实中因为摩擦力不对、材质变形就滑掉了。SceniX在底层引入了可微分物理求解器将接触力建模为可计算梯度的连续函数。这意味着当仿真中的机械臂抓取失败时系统不仅记录“失败”这个结果还能通过梯度回传精确定位是摩擦力不足、力矩超限还是接触角度偏差。每一次失败都变成了一次精准的参数修正。这种“带因果关系的物理仿真”让训练效率呈指数级提升。“多模态传感融合”解决的是机器人的“感知断崖”问题。人形机器人身上有复杂的传感器阵列——视觉、触觉、六维力觉、惯性测量单元。在仿真中训练时如果这些传感器信号不能和真实世界对齐机器人部署到真实环境后就会出现“在仿真中视力2.0现实中近视800度”的尴尬。SceniX利用神经辐射场的变体技术模拟不同传感器在物理空间中的时空一致性——当仿真手指按压物体时视觉渲染的形变、触觉阵列的压力分布图、关节力矩的微小波动在时间线上实现亚毫秒级同步。这种“全模态对齐”训练出的策略部署到真实机器人后极少出现感知断崖。“随机化训练机制”则是SceniX的第三把板斧。真实世界有无穷无尽的边缘案例——地面突然变滑、光照突然变化、物体重心偏移。如果靠人工一个个设计这些场景来训练永远做不完。SceniX内置了对抗性环境生成器系统会自动监控当前策略的弱点动态生成专门针对弱点的极端场景。比如发现机器人在光滑地面上表现不佳就自动增加摩擦力变化的场景发现机器人在暗光下识别率下降就自动调整光照条件。这种“从易到难、专打痛处”的课程学习机制让机器人能以极低的真实数据成本获得极强的泛化能力。这三项技术叠加在一起构成了SceniX的护城河。它不是传统意义上的“游戏引擎改仿真”而是从底层物理求解器开始重建的仿真体系。这也是为什么World Labs愿意为一个10人团队开出高价——因为这套技术巨头短时间内自研不出来。但World Labs并不是这条赛道上唯一的玩家。英伟达凭借Omniverse、Isaac和MimicGen三大平台已经构筑了显著的先发优势。谷歌、微软也在积极布局。市场上还有大量初创企业和开源项目虎视眈眈。根据行业预测2025年全球具身智能机器人仿真平台市场规模突破2亿美元预计到2032年将达21亿美元年复合增长率高达47.7%。这个市场的竞争本质是仿真平台正在从“辅助工具”演变为“核心基础设施”。谁能提供最高保真、最高效率的仿真环境谁就能在具身智能的研发竞赛中占据先机。李飞飞的这次收购让我想起了一个更深远的变化。过去两年AI最大的突破都集中在语言领域——ChatGPT、GPT-4、Claude它们能写诗、能编程、能分析财报但所有这些能力都只存在于“文字的世界”里。李飞飞正在做的事情是要把AI从“文字的世界”拽进“物理的世界”。她说过一句话“整个智能体竞赛只有等到仿真技术成熟才能真正规模化。”这句话的分量需要放到整个AI发展的脉络里才能体会。当前的大语言模型本质上是一个“文字沙盒”——它们可以生成任何文字但永远无法理解“拿起一个杯子”意味着什么。它们不知道重力、摩擦力、惯性不知道玻璃杯摔在地上会碎不知道热水倒进杯子里杯子会变烫。而空间智能要做的就是让AI获得这些物理直觉。World Labs的Marble世界模型加上SceniX的仿真闭环正在搭建一个从“生成世界”到“在世界中行动”的完整技术栈。想象一下这个流程Marble根据一段文字描述生成一个高保真的三维厨房场景SceniX在这个场景中创建一个物理仿真环境人形机器人进入这个环境学习打开冰箱、拿起鸡蛋、打蛋、倒进锅里。在这个过程中机器人可能会摔碎鸡蛋、打翻锅、被蒸汽烫到——但没关系这些都是在仿真中发生的成本为零。经过成千上万次失败和优化机器人最终学会了做一份完美的煎蛋。然后这个训练好的策略被部署到真实的人形机器人上——它走进一间真实的厨房打开真实的冰箱拿起真实的鸡蛋做出了和仿真中一模一样的煎蛋。这就是“real-to-sim-to-real”的闭环。它意味着训练机器人的成本将从“天价”变成“几乎免费”。它意味着机器人的技能学习将从“教一个动作需要几个月”变成“几小时学会一个动作”。它意味着具身智能将从实验室走向工厂、仓库、医院、家庭。当然这条路还很长。仿真永远无法100%还原真实世界的复杂性。灰尘、磨损、温度变化、不可预测的人类行为——这些“混乱”是仿真最难模拟的部分。但方向是对的。李飞飞和World Labs正在做的事情本质上是在为AI搭建一个“物理世界的学校”。在这个学校里AI可以犯错、可以重来、可以试错无数次直到真正学会为止。值得一提的是NVIDIA也在同一赛道上紧锣密鼓地布局。其Cosmos世界模型平台与Omniverse、Isaac Sim形成了从场景生成到机器人训练的全链路闭环。英伟达CEO黄仁勋在多个公开场合反复强调“物理AI”是下一波AI浪潮的核心。这和李飞飞的观点不谋而合——两家公司虽然在商业上是竞争对手但他们对技术趋势的判断高度一致。这种“英雄所见略同”的局面恰恰说明空间智能走向具身化不是某个人的一厢情愿而是整个行业正在形成的共识。最后说一个细节。SceniX的三位联合创始人中有两位是哥伦比亚大学的教授。这意味着什么意味着李飞飞买下的不只是10个人的团队而是哥大在机器人仿真领域积累多年的学术成果。在硬科技领域顶尖学术机构的研究积累往往比商业公司的短期研发更具前瞻性和深度。李飞飞本人就是斯坦福的教授她太清楚学术资源在硬科技赛道上的价值了。2026年7月21日当李飞飞写下“世界不止由文字组成”这句话时她其实在说AI的下一个战场不在云端不在服务器而在你脚下的这片土地在你手中的这个杯子在每一寸可以被触摸、被感知、被改变的真实空间里。空间智能终于要碰到真实的铁与电了。

相关新闻