ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

具身智能“GPT时刻”降临:宇树智元共用“大脑”,10分钟零打断,一个粗糙视频炸出行业未来

具身智能“GPT时刻”降临:宇树智元共用“大脑”,10分钟零打断,一个粗糙视频炸出行业未来 具身智能“GPT时刻”降临宇树智元共用“大脑”10分钟零打断一个粗糙视频炸出行业未来两个互为竞品的机器人本体在同一套通用大脑的调度下自主规划、协同作业、互相补位、自我进化。当全球顶级团队还在用精修短片展示“机器人能做什么”时这个神秘模型直接用一段未经修饰的长镜头平静地宣判了旧时代的终结——机器人已经可以“自己决定做什么、怎么做、什么时候停、和谁一起更省力地做”。01、一段视频让整个行业陷入沉默今天的科技媒体圈被一段来源不明的视频彻底炸开了锅。知名科技媒体量子位发布了一篇深度报道描述了一段长达十分钟、一镜到底、无剪辑、无分镜、无重拍、无场外遥控、无人工指令介入的机器人Demo视频画面甚至有些粗糙拍摄场地不过是一个约15平方米的狭小出租屋过道狭窄到人类转身都费劲摄像机视角受限光线也并不理想。但恰恰是这样一个“地狱级”的真实居家环境里两台人形机器人——宇树科技的G1和智元机器人的远征A3这两个在市场上互为竞争对手的硬件产品——正在共用同一套通用智能大脑并肩工作默契得像一对合作多年的老搭档。擦玻璃、擦完把刮水器精准归位、从洗衣机取衣物、分类收纳、开关冰箱、判断食物是否该冷藏、取出需解冻的食材、整理桌面杂物、把围巾温柔地挂在同伴脖子上、甚至自主寻找箱子垫高自己去够高处……整整十分钟没有卡顿、没有迷路、没有报错崩溃有的只是对物理世界的深度理解、自主推理决策、实时纠错、动态调度、以及近乎人类的“偷懒”智慧。看完这篇报道和附带视频片段我坐在电脑前愣了许久。一个直觉告诉我这可能就是我们一直在等的具身智能领域的“GPT时刻”。02、为什么说这次“彻底不一样”——从“数据直觉”到“物理智能”的范式跨越在深入拆解这段视频的每一个细节之前我们需要先冷静地回顾一下过去一年具身智能行业到底在争论什么以及为什么这次展示出的能力让所有业内人士都感到“后背发凉”。过去几年我们看过了太多精心剪辑、打光考究、配乐激昂的机器人Demo。在聚光灯下它们能跑能跳能抓取动作流畅配合默契仿佛距离走进千家万户只有一步之遥。但剥开那些华丽的包装背后的真相往往令人尴尬——预设脚本、绿幕抠图、远程遥操、定点重拍、分段剪辑这些在行业内已经是心照不宣的“公开秘密”。一旦将这些“演示王者”扔进真实世界面对物体的遮挡、光线的变化、接触面的形变、空间的未知变动它们立刻从“超级英雄”变回“人工智障”连最基本的环境适配都难以完成。过去两年具身智能行业内部一直爆发激烈路线论战。两大主流技术路线VLA视觉-语言-动作模型、WAM世界动作模型各有支持者但两者都遇到难以逾越的底层瓶颈。VLA也就是视觉语言动作模型我们可以称之为数据直觉派。代表模型包括RT‑2、OpenVLA等。逻辑非常直接输入图像 语言指令直接输出机器人动作本质学习 “看到什么画面输出什么动作” 的映射关系大量依靠人类遥操作采集的三元组训练数据。优势是推理速度快部署轻量化但致命短板在于它并不真正理解物理世界。它学的是数据统计出来的概率不是物理因果一旦遇到训练集没有见过的新场景、新交互很容易输出荒谬动作。长时序任务下误差会持续累积任务越往后动作偏离目标越严重并且模型高度绑定本体硬件换一台机器人就要大规模重新适配训练。WAM 世界动作模型可以称之为预判空想派。它的思路发生变化不再直接输出动作而是先预测执行动作之后世界会变成什么画面基于预判画面反推应该输出怎样的动作。它具备一定的物理预判能力但是存在致命的“知行割裂”。模型可以在想象空间当中推演世界变化但是很难把推演结果转化成满足真实动力学约束的机器人关节轨迹看得懂想得明白但是做不准。同时推理算力开销巨大延迟高真实机器人上实时落地难度很高。归根结底当下所有主流赛道本质都是“数据驱动的任务拟合”。所有动作都是基于海量数据的“概率猜测”而非对物理规则的理解。模型的能力上限被训练数据牢牢锁死面对遮挡、接触、形变等需要真正物理推理的长尾场景时极易失效遇到新场景、新交互、新硬件即刻翻车。这也是为什么行业Demo永远局限于短时长、单任务、无干扰的标准化场景因为一旦把时长拉长把任务复杂度提升到多目标、多步骤绝大多数模型会在30秒内崩溃。而今天这支神秘团队流出的10分钟绝密长镜头Demo从第一帧到最后一帧彻底跳出行业固有框架从底层逻辑上绕过了VLA和WAM几十年无法跨越的物理交互鸿沟。它不是数据堆出来的“条件反射”而是基于物理规则实时计算、基于本体能力实时评估、基于任务目标自主规划决策的真正的“智能”。用一句话概括其他模型在“猜”动作这个模型在“算”动作并且“算”完之后还能不断“学”。视频中最震撼我的一个细节是机器人擦玻璃我认为这个场景展现了机器人有了真正的“自主推理”图源量子位宇树G1机器人用刮水器擦拭室内玻璃几下之后发现有一处擦不干净。它没有卡住也没有报错而是 “思考” 后做出推理——脏污可能在玻璃外侧。于是它侧身、后仰、探头、展臂将拿着刮水器的手精准地伸出窗外完成了外侧擦拭。这一套动作背后是对空间感知、动力学解算、力矩控制的三位一体融合。它知道自己手臂多长、窗户边框在哪里、伸出去会不会撞到、用多大力能擦干净。这不是数据能“喂”出来的这是模型对物理规则的深度理解和实时运用。还有一个画面是视频进行到一半设定的闹钟突然响起两台机器人立刻中断手中的家务活优先执行“收纳桌面和冰箱”的临时指令。更神的是完成这项“插队任务”后它们又精确恢复了此前被打断的任务——去洗衣机取衣物继续收纳。这种多任务动态调度和情景记忆恢复能力在全球范围内是首次在机器人身上展现。此前的Demo只能执行单一串行任务中途遭遇干扰基本就是“任务崩盘”。整段视频的最高潮出现在两个机器人互动的瞬间。面对桌面上一堆杂物宇树机器人双手占满难以一次性搬完。智元机器人“看懂”了局面自主决策将一条围巾挂在了宇树的脖子上发现围巾过长宇树甚至配合地弯下腰让智元将围巾绕过自己的头部。图源量子位随后宇树尝试将围巾放到高处的柜子身高1.3米的它够不到便自主找到一个箱子企图垫高。发现弯不下腰搬箱子它一脚把箱子“踢”到了柜子旁。智元机器人看到同伴的困境立刻放下手头工作走过来凭借1.7米的身高优势取下围巾折叠整齐放进了衣柜。这是一段没有语言交流、只有基于共同目标的默契配合。全球首次跨品牌人形机器人的实时交互与动态协同。它证明这套“通用大脑”完全解耦了硬件可以适配任何品牌、任何构型的机器人。这对整个行业的分工模式将是颠覆性的。虽然神秘团队尚未公开技术细节但从视频中展现出的能力特征行业专家已经可以做出相当深入的推断。这套模型之所以能做到VLA和WAM都无法企及的事情核心在于三大底层技术内核的全面创新。内核一物理约束动力学学习——告别数据拟合拥抱真实世界推理区别于VLA和WAM纯数据驱动的训练模式这套模型的核心逻辑是“物理规则前置、动力学预测驱动”。传统VLA模型学习的是“看到画面A最可能输出动作B”的统计相关性它不理解为什么动作B是对的也不理解如果环境发生微小变化动作B需要如何调整。而视频中的模型所有动作轨迹都不是数据的概率拟合而是基于重力、力矩、受力、空间约束的实时计算结果。当机器人用刮水器擦玻璃时它不是在回忆“训练数据里擦玻璃的动作是什么”而是在实时计算刮水器与玻璃表面的接触力需要多大当前角度下手臂关节需要输出多少力矩如果玻璃表面有污渍摩擦力会如何变化力矩该如何补偿当手臂伸出窗外时机身重心偏移了多少需要如何调整站姿来保持平衡这种“基于物理规则实时计算” 的范式使得模型具备了绝佳的外推泛化能力。它不需要见过“伸出窗外擦玻璃”这个具体场景的训练数据因为它理解“擦玻璃需要多少力”、“手臂伸出窗外需要如何调整平衡”这些底层的物理规律。只要理解了物理规律任何新场景都可以现场推导出最优动作。拎拖鞋挂绳、肩搭毛巾、站箱子登高、用脚踢箱子——这些动作都没有出现在任何训练数据里但模型通过与环境的实时交互和物理规则的约束自主探索出了这些最优解。内核二跨本体统一建模——终结“硬件绑定算法”的时代过往机器人模型与硬件深度绑定的根源在于不同本体的运动学参数、自由度、传感器特性差异巨大。宇树G1和智元远征A3一个身高1.3米一个身高1.7米一个轻巧灵活一个负载更大它们的关节数量、活动范围、力矩输出特性完全不同。以往为宇树开发的算法完全无法迁移到智元上反之亦然一切都得重来。这次视频中的模型通过统一的动作表示空间与本体自适应机制让同一套模型可以同时适配两个完全不同品牌的硬件平台并完成不同本体的完美算法耦合。这相当于为具身智能完成了一次“软硬件解耦” 。就像Windows操作系统可以安装在联想、惠普、戴尔等任何品牌的电脑上一样这套“通用大脑”可以部署在任何构型的机器人身上。它剥离了硬件的差异化参数只保留通用的物理推理、任务决策、运动基元。跨品牌协同的实现更是证明了这套通用大脑的兼容性与泛化能力已经达到了全球最前列。这一突破对行业分工模式的冲击将是颠覆性的。硬件厂商不再需要自研算法可以专注于提升关节精度、续航能力、成本控制AI公司不再需要绑定特定硬件可以专注于让“大脑”更聪明整个产业链将被彻底重构。内核三长时序鲁棒闭环——支撑超稳定真实场景落地10分钟无干预长流程作业考验的不是单任务的执行精度而是全链路动态纠错、误差抑制、时序规划的系统能力。传统VLA模型之所以无法做长序列任务是因为每一步的微小误差会持续累积到后面完全失控。就像蒙着眼睛走路偏了一度走十米后就偏到了一米外。而视频中的模型依托全局任务调度框架实现了三个关键能力第一实时误差修正。每一步动作完成后模型都会通过视觉和力觉反馈确认结果如果发现偏差比如刮水器没有完全擦干净立刻调整下一步的策略。第二动态任务调度。闹钟响起的瞬间切换任务完成后精确恢复这背后是一套完整的任务状态管理和优先级调度系统。第三长程规划与短程执行的结合。模型既有“10分钟内整理完整个房间”的长程规划又能根据实时反馈灵活调整短程动作。这三大内核的综合作用使得视频中的模型具备了代差级的优势。03、行业地震终结“本体之争”开启“大脑时代”一个万亿级市场正在被重新定义如果这个神秘模型的真实性得到确认其技术路径被验证可规模化那么它对整个具身智能行业的影响将是地震级别的。它不是在原有赛道上超越对手而是直接重新定义了比赛本身。一、“通用大脑”终结硬件的“军备竞赛”过去几年具身智能行业陷入了一场关于“本体”的军备竞赛。每家公司都在打造自己的专属硬件平台并为之开发专属算法。这种模式导致两个严重问题第一重复造轮子。每家公司在算法层面的投入大量重复因为彼此不通用。第二锁定效应。一旦选择了某款硬件就被绑定在了该硬件的能力边界内很难迁移。而“通用大脑”的出现将彻底终结这场“本体之争”。就像智能手机时代的Android系统高通芯片各家整机制造商的分工模式一样具身智能行业也将迎来“通用大脑专业本体场景应用”的三层分工。硬件厂商可以专注于提升运动关节的精度和寿命、电池的续航能力、整机的成本控制AI公司可以专注于让“大脑”更聪明、推理更快、泛化更强应用开发商可以专注于理解具体场景需求开发上层应用。产业分工的细化是一个行业走向成熟的标志。这场变革将催生出一批新的巨头同时也可能让那些“算法绑定硬件”的封闭生态面临严峻挑战。二、Scaling Law被改写数据和算力不再是唯一护城河一个令人震惊的信息是有消息称视频中的模型仅用了“几十个小时”的视频数据训练就达到了视频中展现的效果。如果这一消息属实那将是对当前行业“数据崇拜”的一记响亮耳光。过去几年行业的主流叙事是“数据越多越聪明”——Scaling Law规模定律被认为在具身智能领域同样适用。各家大厂疯狂采集数据、堆叠算力、扩大模型参数规模认为这就是通往通用智能的唯一路径。但视频中的模型似乎证明了另一条路的存在对物理世界底层规律的理解比数据的堆砌更有效。几十个小时的数据放在今天的大模型训练中简直是“九牛一毛”。但模型却展现出了极强的泛化能力和自我进化能力这意味着学习效率可能比数据规模更重要。当然我们必须保持审慎。“几十个小时”这个信息尚未得到官方确认具体的数据质量、训练方式、算力规模也都不清楚。但即便数据量被低估了一个数量级如果模型真的能在远小于行业惯常数据规模的情况下达到如此效果那Scaling Law的确需要重新审视了。未来的竞争可能不再是“谁的数据多”而是“谁更懂物理世界”。三、具身智能的“ChatGPT时刻”真的来了2022年11月ChatGPT的发布让全世界第一次感受到了大语言模型的真正威力。那一刻人们意识到AI不再是玩具它真的可以成为生产力工具。而今天这段10分钟的视频或许正是具身智能领域的“ChatGPT时刻”。它用最朴素、最直接的方式告诉我们机器人真的可以进入家庭干活了而且能干得比人类更好、更稳定、更不知疲倦。擦窗户、收纳衣物、整理房间、取快递、做饭暗示——这些家务活机器人正在一项一项地攻克。视频中的场景虽然只有10分钟但已足够让我们窥见未来的生活图景一个“通用大脑”调度家里的多台机器人它们各司其职、协同作业把人类从繁琐的家务中彻底解放出来。这不仅仅是生活品质的提升更是生产力的革命。当数亿家庭的家务劳动可以被机器人替代时释放出来的人类时间和精力将流向更有创造性的领域。四、从工厂到家庭应用场景全面打开在视频之前行业对具身智能的落地更多聚焦在工业场景——工厂流水线上的分拣、搬运、装配。因为这些场景相对结构化更容易实现。而视频中的场景选择了一个极度非结构化的居家环境恰恰展示了这套“通用大脑”在最复杂场景中的能力。如果家庭场景都能驾驭那工厂、物流、商业服务等相对简单的场景更是“降维打击”。我们可以大胆畅想家庭服务擦窗机器人、衣物整理机器人、厨房助手、老人陪护……每个家庭可以根据需求配置不同本体但共享同一个“通用大脑”所有机器人越用越聪明越协同越默契。商业服务酒店客房服务、餐厅送餐、商场导购、医院护理……机器人不再需要针对每个场景单独开发算法一套“大脑”适应所有场景。工业制造不同工位、不同操作、不同产品的需求都可以由同一套智能系统调度适配真正实现柔性生产。公共服务灾后救援、危险环境作业、太空探索……人类去不了、不想去的地方机器人可以去而且可以协同去。五、“神秘团队”引发的行业猜想与焦虑目前最大的悬念仍然是这究竟出自哪家公司、哪个团队量子位的报道和本文都无法给出答案。从视频的呈现来看这个团队刻意保持低调甚至匿名——他们放出的是一段粗糙的、未经包装的原片没有logo、没有署名、没有说明文字。这种“不炫技、直接亮底牌”的姿态反而让整个行业感到了前所未有的压力。有人说可能是某家低调的创业公司有人说可能是某个顶尖高校的实验室也有人猜测是某家大厂的“秘密项目”。但无论答案是什么这个团队已经用一段视频宣告了自己的存在并且把技术标准推到了一个令所有人望尘莫及的高度。可以预见的是接下来整个行业的投资逻辑、技术路线、人才流向都将发生剧烈变化。那些还在坚持“本体绑定算法”路径的公司将面临巨大的转型压力那些相信“数据越多越聪明”的团队需要重新思考Scaling Law是否仍然成立那些以为“通用智能还很遥远”的投资者可能需要连夜调整估值模型。一个视频炸出了一个新时代。原文链接具身智能“GPT时刻”降临宇树智元共用“大脑”10分钟零打断一个粗糙视频炸出行业未来-36氪
返回列表