ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

孙正义60亿押注人形机器人:从1X看懂具身智能技术栈与AI开发者的机会

孙正义60亿押注人形机器人:从1X看懂具身智能技术栈与AI开发者的机会 孙正义通过软银向人形机器人公司 1X 押注约 60 亿美元的消息一出行业内讨论最多的不是“孙正义又开始买买买”而是“为什么偏偏是现在为什么偏偏是 1X”。人形机器人不是新概念过去几十年每隔几年就会冒出一波融资和演示但真正能走进家庭、商超和工厂的产品至今仍然屈指可数。这次不一样的地方在于资金规模、技术路线以及 AI 大模型带来的新变量都让人形机器人从“实验室话题”变成了一个需要认真评估的产业命题。下面不按新闻稿的路子来。我直接从 1X 这家公司到底在做什么、人形机器人要过哪些硬门槛、以及软件和 AI 开发者如果真打算入局应该从哪里开始把这件事背后的技术逻辑拆开讲。1. 孙正义这笔钱押的到底是什么人形机器人拐点的信号意义1.1 为什么是 1X而不是那些更有名的机器人公司提到人形机器人很多人第一时间想到的是波士顿动力或者特斯拉 Optimus。但 1X 在这批公司里走的是另一条路它更强调“AI 驱动”而不是“硬件表演驱动”。公开信息显示1X 总部在挪威旗下有两条主要产品线一款是轮式移动加机械臂的 EVE已经做过安保巡检类场景的尝试另一款是双足人形 NEO目标场景是家庭和办公环境。和那些一直追求跑酷、空翻的演示路线不同1X 更想解决的是“机器人能不能在真实环境里干杂活”。孙正义对人形机器人并不是第一次出手。早年的 Pepper 就是软银和 Aldebaran 合作的结果后来软银也曾参与波士顿动力的股权投资。Pepper 那个阶段问题不在资本而在 AI 能力不够机器人的理解、交互、操作都太机械热闹一阵之后很难持续商业化。这次再回来手里的牌变了。大模型解决了“理解指令”和“多模态感知”里很大一部分问题剩下的关键不再是让机器人听懂话而是让它把手上的动作做得足够稳、足够快、足够便宜。所以这笔 60 亿美元押的不是一家公司而是一条完整的判断人形机器人已经从“机械臂 轮子”的工业自动化逻辑转向“数据、模型、硬件三者一起迭代”的具身智能逻辑。谁先把这条路跑通谁就能把机器人从固定产线搬到开放世界。1.2 这笔融资透露的几个行业信号先说规模。60 亿美元放在 AI 和机器人行业里都不是小数字。通常一个硬件公司拿到这么大一笔钱意味着投资人对它的预期不是“做出一台演示机”而是“建设一条可持续迭代的产品链路”。这类资金一般会流向四个地方数据采集团队和遥操作基础设施、训练用的算力与模型研发、仿真平台、以及供应链和量产准备。再看选型。孙正义选择 1X而不是更炫技的公司说明资本开始更看重“能落地的任务场景”和“AI 训练闭环”而不是单点的硬件能力。EVE 这种轮式机型虽然没有双足那么吸引眼球但它更容易先在园区、仓库、办公空间里跑通任务闭环。这也是一个很典型的商业判断先能在真实世界收到钱再逐步推进更复杂的双足形态。还有一个容易被低估的信号这轮投资之后人形机器人赛道会吸引更多 AI 工程师入场。以前做机器人需要懂大量底层控制、嵌入式开发和机械设计现在大模型把“任务理解”这一层标准化了更多软件工程师可以在更高的抽象层上做开发。赛道的人才结构正在从“机器人专业”转向“AI 背景 机器人基础”。2. 1X 的核心技术路线从遥操作采集到模仿学习与强化学习2.1 两条产品线的具体分工理解 1X 的技术路线先要分清它的产品定位。产品形态主要场景核心优势技术重点EVE轮式底盘 双臂安保巡逻、仓库整理、办公服务移动稳定、结构简单、故障率低导航、抓取、移动操作NEO双足人形家庭清洁、整理、陪伴辅助类人外形、空间适应性强双足平衡、上肢作业、人机安全EVE 用轮子不刻意模仿人的移动方式这其实是很务实的选择。轮式结构在室内平面场景里稳定性远超双足而且底盘成本低、调试快适合先跑商业闭环。NEO 则是面向未来家庭场景的形态双足可以上下楼梯、跨过障碍但因为自由度更多控制难度和成本也会成倍上升。如果只看新闻容易把注意力全放在“双足能不能站稳”上。但从实际落地看EVE 这种更简单的形态反而更容易先形成数据闭环。机器人能不能干活比机器人像不像人重要得多。2.2 “AI 优先”而不是“编程优先”传统工业机器人是“编程优先”工程师把每一个动作路线、速度、角度写进脚本机器人严格按照轨迹执行。这在固定产线上没问题但到了家庭和办公室物体位置、光照、物品形状都在变死脚本根本写不完。1X 这类公司走的是“AI 优先”路线核心是四步通过遥操作让人类远程控制机器人完成具体任务同时录制轨迹数据。把大量轨迹数据整理成训练集让模型学习“看到什么状态应该输出什么动作”。用模仿学习先学会基本行为再用强化学习在仿真中大量试错提升成功率。部署到真机后继续采集数据形成“真实场景数据 仿真训练 模型更新”的循环。为什么要用遥操作因为真实世界太复杂。物体材质、摩擦、形变、遮挡、环境光照这些在仿真里很难完全模拟。与其费尽心思建模不如让真人远程操控机器人干活把真实轨迹直接录下来。这个思路听起来简单但落地时工程量很大你要建设一套低延迟、高保真的遥操作设备还要给大量任务的轨迹打标签比如哪一步成功了、哪一步失败了、失败原因是什么。2.3 大模型在人形机器人里到底起什么作用很多人以为“给机器人接一个大模型它就会干活了”这是误解。大模型在人形机器人里不是直接输出电机指令而是分层配合任务规划层理解用户指令拆解成子任务。比如“把餐桌整理干净”拆成“识别餐具、端起碗、放进水槽、擦拭桌面”。技能层把每一个子任务对应到一个动作策略。这个策略可能是从遥操作数据里学出来的也可能是在仿真里通过强化学习训出来的。运动控制层把动作策略转换为关节扭矩、速度和位置指令同时处理平衡、避障、力控。语言模型和视觉模型主要负责前两层真正的执行力还是依赖底层的控制策略。所以人形机器人项目里最缺的不是“懂 prompt 的人”而是能把视觉、语言、动作统一起来训练并保证策略在真机上稳定运行的人。3. 人形机器人的三层技术栈别只盯着“外形像人”3.1 硬件层关节、传感器和算力是真正的成本黑洞外形只是表象。一台人形机器人真正贵的部分通常藏在关节里。人形机器人全身一般有二十到四十个自由度每个关节都要配电机、减速器、编码器和驱动器。高扭矩密度关节、谐波减速器、力矩传感器这些都是成本大头也是目前产能和可靠性的瓶颈。传感器方面机器人需要深度相机、IMU、六维力传感器有些方案还会加触觉传感器。为了在家庭环境里安全作业触觉和力感知几乎是必需品否则机械臂很容易夹到东西或者撞到人。机载算力又是一个问题。训练可以在云端做但推理必须放在机器人本体上。因为控制回路要求高实时性网络往返那几十毫秒延迟对动态抓取来说太长了。机载要装 GPU 或 NPU 类硬件这就带来功耗、散热和成本的连锁问题。3.2 算法层感知、决策、控制不再是三个独立模块人形机器人算法栈主要分三层感知层负责物体检测、语义分割、姿态估计决策层负责任务拆解和路径规划控制层负责把高层意图转换成关节运动。传统的做法是这三层各做各的模块之间用接口衔接。但现在的趋势是端到端训练让视觉输入直接映射到动作输出例如 VLA 模型和扩散策略。VLAVision-Language-Action模型是目前比较被看好的方向把视觉、语言、动作三部分联合建模模型输入是“相机画面 用户指令”输出是动作轨迹。这种模型的好处是能利用互联网规模的文本和图像数据做预训练再用真机数据微调。难点则在于动作数据量太少而且每个机器人形态不一样动作空间不完全通用。仿真也是算法层很重要的一环。MuJoCo、Isaac Lab、Isaac Sim 这类平台被用来做强化学习的并行训练、场景泛化测试和数据增强。仿真做得好可以大幅减少真机试错成本但仿真和真机之间的差异仍然存在行业内称呼这为系统误差通常需要用域随机化技术来缓解。3.3 软件工程层机器人本质上是分布式实时系统很多 AI 工程师第一次接触机器人时最容易低估的不是模型而是软件工程复杂度。一台人形机器人内部有多个传感器、多块计算板卡、几十个电机所有这些组件要通过实时总线通信还要和云端训练平台同步数据。从工程角度看机器人项目至少要包含这些模块中间件与通信现在主流是 ROS 2基于 DDS 的发布订阅模型负责进程间通信。数据平台收集遥操作轨迹、真机运行日志、图像和关节状态做清洗、标注、回放。训练平台负责模型训练、仿真评测、权重版本管理。部署系统把训练好的策略固化成机载推理服务并提供监控和远程更新能力。这一整套东西和互联网公司的分布式系统有很多相似之处但又多了一条硬约束实时性。控制循环通常要求 10Hz 到 1kHz 的更新频率一个延迟抖动可能直接导致机器人失衡。做这部分工程的人既要懂云原生工具链也要懂实时系统的资源管理。4. 想入行的开发者可以从哪里开始仿真环境、开源工具和一个最小路径4.1 仿真平台怎么选如果你现在没有一台真实的人形机器人最合理的起点就是仿真。不同仿真平台适合不同目标平台特点适合任务学习成本MuJoCo轻量、物理精度高、API 简单强化学习、运动控制算法低PyBullet安装简单、文档友好机械臂控制、碰撞检测很低Isaac Lab基于 NVIDIA支持大规模并行训练成百上千环境并行 RL高Isaac Sim渲染强、支持多传感器视觉策略、抓取仿真、数字孪生高我的建议是先从 MuJoCo 开始。原因很简单它在普通笔记本上就能跑API 简洁社区资料多。先把身体模型加载进来、执行几步仿真理解状态、动作、奖励之间的关系再决定要不要升级到 Isaac 这类重型平台。下面是一个最简单的 MuJoCo 最小示例import mujoco # 加载一个人形模型路径换成你自己的 XML 文件 model mujoco.MjModel.from_xml_path(humanoid.xml) data mujoco.MjData(model) for step in range(1000): # 给所有关节设置随机动作 data.ctrl[:] 0.0 mujoco.mj_step(model, data) if step % 100 0: print(step, step, height, data.qpos[2])这个例子本身没实际价值但能帮你确认环境、模型加载、控制循环这三个基础环节是否通顺。跑通之后再逐步加奖励函数、加监督信号、加外部干扰。4.2 一条比较稳妥的入门路径按我的经验从零开始进入人形机器人方向可以按下面这个顺序走先学 ROS 2 的基本通信方式订阅和发布一个话题比如让一个仿真小车收到指令后移动。在 MuJoCo 里加载一个人形或机械臂模型手动控制某个关节理解运动学正逆解。给一个简单任务定义奖励函数用强化学习训练一个能完成任务的策略比如让机械臂末端到达目标点。加入视觉信息输入一个相机图像让模型根据图像输出动作。尝试收集一组“人类操作生成的轨迹”用行为克隆训练一个模仿策略。每完成一步都给自己设一个明确的验收标准。比如第 3 步标准是“策略在 10 次随机初始条件下有 8 次以上成功到达目标点”。没有验收标准很容易陷入调了一晚上参数但不知道算不算成功的状态。4.3 怎么判断自己学到的能力有没有用判断标准很简单你能不能独立跑通一个闭环任务。所谓闭环是机器人感知环境、执行动作、观察结果、调整动作整个过程不靠人手动干预。如果只能跑通某个开源示例不算掌握能把示例换成自己的任务定义、自己的奖励函数、自己的场景参数才算入门。另一个判断标准是定位问题的能力。训练时策略发散你能判断是奖励设计问题、状态表示问题还是环境步进逻辑问题这种排查能力在真实项目中比背模型结构重要得多。5. 别被 Demo 骗了从演示到量产还有哪些硬门槛5.1 演示视频里没告诉你的那些事行业里有一个老问题机器人演示视频的真实性。一台机器人在视频里完成了叠衣服、做咖啡、整理桌面看起来很厉害但观众不知道背后拍了几十次、中途有没有人手干预、场景有没有固定、物体位置有没有被刻意摆好。看人形机器人演示优先关注四个细节物体位置是不是每次都不一样。有没有加入光照变化、遮挡、干扰物。失败之后系统是自动重试还是需要人帮它复位。整个流程是实时运行还是前期剪辑。即便是真实演示实验室里 80% 的成功率和量产场景里 99.9% 的可靠性也完全不是一回事。实验室数据通常是在受控条件下统计的而真实世界里的机器人要面对老鼠走过传感器、桌布被风吹动、老人说话带口音这一类意外情况。5.2 生产环境真正要看的四项指标判断一台人形机器人能不能落地不要只看它“会不会做某个动作”要看下面几个指标指标含义一般怎么测平均无故障时间连续运行多久才出一次故障连续运行累计时长除以故障次数任务成功率给定任务在随机条件下的完成比例随机初始化环境跑 N 次统计部署周期新场景从进场到稳定运行要多久记录从安装到连续运行一周无重大问题的耗时维护成本换件、维修、校准的成本和频率统计易损件寿命和单次维护工时这四个指标里最容易造假的是任务成功率因为“随机条件”的范围可以被定义得很窄最容易被低估的是维护成本因为关节电机和传感器在长期使用后会有磨损实验室阶段的机器人很少跑满几万小时。5.3 成本和安全的边界在哪里人形机器人单台硬件的成本目前普遍在几万美元到十几万美元之间如果要进家庭这个价格至少要降到接近汽车甚至更低的水平同时维护还得足够简单。成本降不下来人形机器人就只能停留在展厅和高端工业场景。安全是另一个硬约束。机器人要和人共处一室必须在结构上做柔性设计、在算法上做力控和碰撞检测、在系统上做多级急停。摄像头和数据采集还会涉及隐私问题家庭场景里用户能不能随时关闭视觉采集、数据怎么加密存储这些都是产品化阶段绕不开的事情。6. 对软件和 AI 从业者意味着什么机会、坑点和务实建议6.1 机会集中在哪几个方向如果这轮 60 亿美元的投资能按预期落地产业里最先放大的可能不是机器人硬件岗位而是软件和 AI 岗位。具体来说这几个方向会持续缺人数据工程搭建遥操作数据采集链路做轨迹数据的清洗、标注、回放和质量评估。仿真工具链把真实场景快速迁移到仿真环境做并行训练和自动化评测。策略模型训练研究 VLA 模型、扩散策略和模仿学习做真机部署和性能调优。系统集成把感知、决策、控制、云端训练平台组合成一个可运维的整体。传统机器人公司和互联网大厂之间的人才也明显开始流通。机器人公司需要懂大模型的人AI 团队也需要懂物理系统和实时系统的人。这种交叉背景现在是稀缺资源。6.2 几个容易踩的坑第一只跑通一次 demo 就以为任务解决了。真实项目里策略稳定性和泛化能力更重要必须在大量随机条件下反复验证。第二忽视数据质量。很多团队一心扩大数据量却不给数据做失败标注和场景分类最后训出来的模型看起来 loss 很低真机上却频繁出错。机器人数据里“成功轨迹”和“失败轨迹”同样重要失败数据能告诉模型什么叫不能做。第三仿真和真机差异不做处理。直接拿仿真策略部署到真机经常因为相机标定、执行器延迟、摩擦力不同而完全失败。至少要做域随机化在仿真里随机化光照、纹理、质量、摩擦系数。第四把机器人当成“聊天机器人加一个机械臂”。机器人是一个时序决策问题一步错可能引发连锁失败不能简单复制纯语言模型的交互逻辑。6.3 回到孙正义这轮投资最后多说一句孙正义的 60 亿美元会极大加速 1X 在数据、算力和产品迭代上的投入但它并不会立刻改变人形机器人行业的核心难处。真正决定这个赛道什么时候爆发的还是成本能不能降下来、任务成功率能不能提上去、以及有没有一个稳定的数据飞轮在运行。对想入行的开发者来说现在其实是很好的学习窗口仿真工具免费、论文公开、开源模型越来越多一个人用一台普通电脑就能跑通一个小的人形机器人控制闭环。先别急着追热点把单任务跑稳把数据、日志、评测这些枯燥的事情做扎实机会来的时候你才接得住。
返回列表