ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

【阅读笔记】具身智能的真机数采,到了分水岭

【阅读笔记】具身智能的真机数采,到了分水岭 本篇位置本批第 9 篇也是今天三篇里信息密度最高的一篇是主样本。它把第 8 篇提出的问题缺什么数据、谁会成为主流用一次行业深度访谈做了解答而且给了具体的时间线、成本账和人物名单。第 10 篇知乎技术综述则是理解本篇所有设备名词的底图。阅读提示本文的主要访谈对象是灵初智能技术负责人陈源培另有智在无界、无问智科、宇泛智能、优宝特、云松鼠智能、联想之星等多家机构人士发声信源比第 8 篇均衡得多。但涉及成本、算力、筛选比例的数字多为受访方自报原文未附独立来源已在数字表中逐条标注。一、亮点速读一段话看懂这篇具身智能的竞争重心正在从「本体」转向「数据」。真机遥操作数据是质量最高的数据但算一笔账就知道它撑不起规模一条 30 秒的真机操作数据采集成本 10 到 15 元1 小时约 1000 元凑够 20 万小时要两亿元以上——而这对于大模型预训练而言不过沧海一粟。仿真数据便宜但撞上 Sim-to-Real Gap 的天花板。于是行业在 2025 到 2026 年完成了一次路线切换人类数据第一人称视频、外骨骼触觉手套成为预训练主流真机数据退居精细微调。与这次换锚同步发生的还有模型范式的迁移——从 VLA 转向隐式世界模型因为显式预测下一帧画面的成本高出两到三个数量级。但在所有进展之下本文最锋利的一句话反而是否定式的10 万小时的人类数据有些时候可能还不如 1000 个小时——真正的瓶颈不是采集是消化。二、阅读笔记1. 一次瓶颈认知切换从本体到数据作者开篇给了一个判断过去两年行业角逐焦点是本体谁能造出更能跑、更能跳的机器人进入 2026 年重心正在从硬件转向数据。这个转向的必要性来自一个不对称大语言模型有互联网文本自动驾驶有海量路测数据具身智能面对的问题更棘手——机器人需要学会操作物理世界但物理世界的数据不会天然存在。先算那笔成本账这是全文最有说服力的一段项数字一条 30 秒真机操作数据1015 元采集 1 小时约 1000 元凑够 20 万小时两亿元以上对比参照V-JEPA 训练用视频量超过 100 万小时作者由此点出困局成本高到无法规模化而 Scaling 需要的数据量近乎无底洞。行业里缺数据的声音此起彼伏但很少有人认真算过这笔账——用真机数采填数据缺口成本上几乎看不到出路。2. 那条被逐一验证的路一个排除法论证本节的论证方式我很欣赏是一个干净的排除法。灵初智能技术负责人陈源培逐条否掉三条路路线优势被否掉的理由互联网视频数据量足够大太脏了——清洗互联网数据的成本远远大于现采真机遥操作质量最高不可能把世界上所有场景、所有物体的所有操作都搬到一个素材厂里来仿真数据成本几乎为零Sim-to-Real 先天 gap且仿真自身的 Scaling 也是问题人类数据成本可控、采集灵活结论看来看去唯一一个能够 Scaling 的数据其实就是人类数据。3. 人类数据的两条支线纯视觉 vs 主动传感两家公司殊途同归但对人类数据的定义并不相同——这是本节最容易被读漏的地方。智在无界纯视觉路线用第一人称视频训练模型理解人的行为语义不记录关节角度和触觉信号成本极低、易于规模化已做到20 万小时规模局限这种数据缺一个 duty pose 信息不能很好地恢复接触状态因此无法直接驱动机器人只能用于预训练阶段的表征学习。灵初智能主动传感路线自研62自由度外骨骼触觉手套采集人手操作数据同时记录关节角度和指尖触觉信号精度达到亚毫米级处理后可等同于真机数据直接驱动机器人代价采集需要专用硬件规模扩张速度不如纯视频路线。这就是全篇的核心张力能规模化的纯视觉驱不动机器人能驱动机器人的主动传感扩不快。两条支线目前并行尚未分高下。4. 一条完整的时间线很有存档价值作者梳理了人类数据路线从边缘走到聚光灯下的过程时间事件2024 年底中关村学院孵化的深度机智率先提出人类学习AnthroLearning路线主张用人类第一人称视频训练机器人理解物理世界创始人陈凯出自微软亚洲研究院。此时这条路线几乎没有关注者。2025 年 7 月智在无界发布 Being-H0用 1000 小时人类第一人称视频做具身预训练2025 年 12 月灵初智能发布 Psi-SynEngine 外骨骼触觉手套数采方案走主动传感路线2026 年 1 月Being-H0.5 发布人类视频规模推到近 2 万小时。据智在无界 BeingBeyond 合伙人郑思鹏回忆这个路线也还不是主流2026 年 23 月转折点。英伟达接连发布 EgoScale 和 DreamDojo分别使用 1 到 3 万小时不等的人类视频数据。英伟达并非这条路线的最早探索者但它的入场是关键的验证信号。2026 年 45 月深度机智发布 PhysBrain 1.0灵初智能Psi-R2 基于近 10 万小时人类数据在 MolmoSpaces 登顶智在无界Being-H0.7 扩展到 20 万小时2025 年底海外由前 Google DeepMind 研究员创立的Generalist AI用 27 万小时人类操作数据训练 GEN-0首次在机器人领域观察到 Scaling Law2026 年 4 月宇树科技开源真机数据集2026 年 6 月智元机器人发布具身智能数采 2.0体系并开源 AGIBOT WORLD 数据集校准Generalist 的 GEN-0 我核对了官方博客发布时间是2025-11-042025 年底准确。但27 万小时首次在机器人领域观察到 Scaling Law是厂商自述 中文媒体转述口径官方博客的表述是模型性能随数据规模提升。注意路线分野并非所有公司都押注人类数据。智元机器人6 月和宇树科技4 月走的是更传统的路线——以真机遥操作和仿真数据为主更侧重本体自身的数据闭环而非人类数据的规模化预训练。两条路线目前并行尚未到分出高下的时候。5. 为什么真机数据走不通 Scaling一个理论解释文中引郑思鹏的分析给出了原理层面的解释这是我认为全文理论价值最高的一段真机数据是监督学习的产物。监督学习训练出来的模型只有背板能力泛化能力很差一旦遇到 out-of-distribution 的场景和任务效果急剧下降。而人类视频天然覆盖了更广阔的动作空间分布与预训练的逻辑天然匹配。也就是说真机数据的缺陷不是少而是它的分布太窄——它只覆盖了人类全部可行操作空间里的一小块。6. 范式迁移从 VLA 到隐式世界模型与数据路线转向同步发生的是模型范式的迁移。VLAVision-Language-Action是过去一年的通用范式本质是一套监督学习框架。它的天花板受限于高质量真机数据的稀缺——VLA 模型无法像大语言模型那样遍历所有可行的动作空间。郑思鹏的说法是真机数据能覆盖的动作空间只占全部可行空间的很小一部分。行业因此转向世界模型但世界模型内部也有路线之分显式路线英伟达 Cosmos Policy通过预测视频的下一帧画面来预测状态变化。理论上可行但成本极高——模型需要关注画面中皮肤纹理、衣服褶皱等等元素而这些对机器人决策来说大部分是无关信息。隐式路线Latent World Action Model智在无界选择只建模必要的状态变化不预测完整画面。效率差异是数量级的据郑思鹏给的数据同样 50 小时的数据量显式训练需要约4000 小时GPU隐式大约只有前者的1/80。他的推论是如果扩展到 20 万小时去训练一个模型显式的投入是千亿级别的。智在无界并非唯一押注隐式的公司2026 年 3 月星海图发表LeWM隐式世界模型论文多个操作与导航任务上性能与基础模型相当但成本大幅降低2026 年 6 月无界动力发布MWA™隐空间世界模型在斯坦福等机构发起的RoboCasa榜单上超越了英伟达的 GR00T-N1.6。作者的总结很到位这是一场从监督学习到自监督半监督学习的范式迁移正在重演计算机视觉领域曾经走过的路——先有监督学习起步然后转向自监督实现 Scaling 突破。7. 商业化路线在迭代节奏判断在分化一个基本共识正在形成2B工业制造、物流等可控场景比 2C家庭服务快 3 到 5 年。在联想控股微空间、联想之星和融科资讯中心共同发起的硅基进化论沙龙上几位产业人士给出了实操导向的判断宇泛智能CFO戴恺三个衡量具身智能公司落地质量的务实指标复购率——客户愿不愿意再次买单ROI≥ 30%——替代人效要有可量化的提升经营性现金流——收入不能全挂在应收账款上。他的原话很直接如果你看现在市场上很多具身智能公司他有收入但其实全在应收帐款上过一段时间可能又要归集为坏帐。优宝特机器人创始人范永一个3 岁小孩的比喻人形机器人现在就是一个 3 岁的小孩不要指望他现在去打工挣钱。但如果你相信他是个健康的孩子他一定能长到 18 岁。云松鼠智能创始人黄骏达一个更激进的判断认为五指灵巧手的收敛速度会比行业预期的快得多——不是三到五年更不是五到十年未来两年内就能见分晓。如果成立操作端的瓶颈可能比很多人预期中更早被打破。这个判断值得单独标出来。它和第 8 篇缺灵巧手末端数据、本篇第 9 节数据优先级里精准 3D 位姿排第一指向的是同一个瓶颈——手。8. 钱往哪流资本的分水岭2026 年上半年具身智能赛道融资额达到约 460 亿元人民币。拆开看其中170 亿是早期轮次而这 170 亿里的70% 集中在头部 10 家公司。资本盛宴之下资金实际高度集中。口径核对重要460 亿这个数字我做了交叉检索。2026 年 6 月中旬的钛媒体、投资界PEdaily报道均使用460 亿口径而 2026 年 7 月 10 日中国证券报、经济日报中国经济网、东方财富等报道使用的是具身智能融资半年破 900 亿。两个数字差了近一倍且都出自正规财经媒体。差异大概来自统计口径全球中国、是否含战略投资与上市相关融资、披露口径宽窄但原文没有说明自己用的是什么口径。对外引用时务必选一个并注明来源不要把两者混用。宇树科技的IPO被视为行业的一个分水岭节点。联想之星合伙人高天垚的判断宇树在二级市场千亿问题不大但戴恺提出了一个微妙的反论人形机器人最核心的竞争力在大脑层面但宇树目前在这方面的投入和展现出的认知还没有到那么高的层面。他补充从整个产业的发展来说我希望宇树能够在资本市场取得更大的成功。但同时估值会越来越趋于理性。范永从产业链角度给出另一个框架这个产业链很长关键模组、本体、小脑、大脑每一个环节都能深耕出优秀的企业。如果要做一个全栈且每个环节都强的公司短期内很难。他认为未来三五年能把营收跑起来的更可能是本体企业因为大脑最终要附生到本体上才有落地的市场。高天垚对投资逻辑变化的概括是大家都在看共识的东西还比较多所以我们希望项目的差异化要突出。9. 量不等于质全文最有价值的一节这一节作者用了一句捅破窗户纸的引语作标题我认为这是全篇最该被记住的部分。先是一个类比无问智科创始人刘盛翔行业里大家都在喊缺数据但即使把一千万小时的数据摆在面前能不能用起来也是个大问题就像英伟达的算力基座如果没有 CUDA 生态再好的 GPU 也用不起来。数据同理缺的不仅是数据更是整套的工具链和测评体系。他给出三层框架一套好用的物理 AI 数据基座至少应包括数据本身、配套的工具链、相应的测评体系——就像人一样要边学习边考试边做模仿学习边做强化学习螺旋式成长。这把这个问题的坐标从数据够不够多推到了数据能不能被有效利用。数据生产的瓶颈正在被人类视频路线打破但数据消化的能力——清洗、标注、增强、评测——还没跟上而后者可能才是未来一段时间真正的瓶颈。然后是陈源培那个反直觉的例子给素材方下发一个任务要求采 1000 个任务每个任务采 100 小时凑出 10 万小时。同样的 1000 个任务每个任务只采 1 小时只有 1000 小时。它们在训练上的作用是差不多等效的。换句话说数据的价值主要来自任务和场景的覆盖面而不是同一件事被重复多少遍。盲目堆时长很可能只是在采集成本上做了无用功。他描述的管线有多复杂这部分解释了为什么处理比采集难视觉端调 SAM 模型把操作者的手从画面中分割出来 → 用 inpainting 模型把背景补上 → 调用仿真器把机器人的模型渲染贴上去动作端调世界模型对动作做修正 → 再调强化学习做策略优化。每一个环节在单次执行时都没有问题但全部堆上去放量的时候每个地方都是卡点。他给出的优先级排序这是本批材料里少见的、可操作的判据数据集构建层面任务多样性 物体多样性 场景多样性感知模态层面精准 3D 位姿 触觉模态 2D 图像特征而他自己也说这套标准本身还在研发状态。最后是一个数字比任何论断都更有说服力灵初智能虽然采集了 10 万小时人类数据却只从中筛选出约 5417 小时真机等效数据用于模型训练。10. 收束一次重新锚定作者的总结从数据路线的全面换锚到模型范式的隐式迁移从商业化节奏的分层判断到资本流向的结构性分化具身智能行业正在经历一次深层的重新锚定。真机数采仍然是精细微调阶段不可替代的黄金标准但在预训练层面人类数据正在成为主流。这不是一场零和博弈而是一次行业分工的重新划定。三、重点名词解析VLAVision-Language-Action 模型一句话一个模型同时看懂画面、听懂指令、然后直接输出机器人该做的动作。 准确定义把视觉编码器、语言模型与动作生成头联合训练的端到端机器人策略模型。输入是图像与自然语言指令输出是关节指令或末端位姿序列。本文的要点是VLA本质是监督学习框架天花板受限于高质量真机数据的稀缺——它无法像大语言模型那样遍历所有可行动作空间。世界模型World Model一句话让 AI 在脑子里预演如果我这么做接下来会发生什么不用真去试。 准确定义对环境动态的压缩表示与预测模型学习状态如何在动作作用下演化从而支持规划与想象式训练。本文把世界模型分成两大流派——显式预测画面的下一帧和隐式只建模必要的状态变化。显式世界模型 vs 隐式世界模型一句话显式的是把下一帧画面整个画出来给你看隐式的是只记住变了什么不画细节。 准确定义显式路线如英伟达 Cosmos Policy在像素空间预测未来帧能保留全部视觉信息但计算成本极高且需要建模大量对决策无关的细节皮肤纹理、衣服褶皱等。隐式路线如 Latent World Action Model在隐空间建模状态转移效率可高出两到三个数量级。本文引用的对比是同样 50 小时数据显式需约 4000 小时 GPU隐式约为其 1/80。Latent World Action Model隐式世界-动作模型一句话不画图只在压缩后的理解空间里推演状态怎么变、动作该怎么给。 准确定义智在无界采用的路线把世界模型的状态建模与动作生成放在隐空间进行避开像素级重建的高昂成本。郑思鹏的说法是只建模必要的状态变化不预测完整画面。外骨骼触觉手套Psi-SynEngine 路线一句话戴上带传感器的手套干活手的每个关节角度、指尖使了多大力全被记下来。 准确定义通过可穿戴外骨骼机构直接测量人手关节运动与触觉信号的采集设备。本文提到灵初智能的自研版本为62自由度精度亚毫米级处理后数据可等同真机数据直接驱动机器人使用——这是它相对纯视觉人类视频的关键优势。代价是需专用硬件规模扩张慢。人类第一人称视频数据Ego-centric data一句话以人的视角拍下来的干活视频机器从中学人是怎么操作的。 准确定义以第一人称视角采集的人类操作视频用于具身模型的预训练表征学习。优势是成本低、天然覆盖广阔的动作空间分布局限是缺少 duty pose手部姿态信息无法很好地恢复接触状态因此无法直接驱动机器人。out-of-distributionOOD分布外一句话遇到训练时没见过的场景和任务模型就露馅。 准确定义测试数据的分布与训练数据分布不一致的情形。本文用它解释真机数据路线的根本局限——监督学习出来的模型只有背板能力一旦遇到 OOD 场景和任务效果急剧下降。duty pose一句话手在干活那一刻的精确姿态是判断接触有没有发生、怎么发生的关键信息。 准确定义本文引语中出现的术语指操作瞬间末端执行器手的位姿状态。缺少这个信息就无法还原接触状态这也是纯视频数据无法直接驱动机器人的核心原因。该词在原文中未作定义属直接引用建议以后续一手资料为准。MolmoSpaces一句话一个公开的机器人能力评测榜单测试环境模型在上面刷分。 准确定义本文提到灵初智能 Psi-R2 基于近 10 万小时人类数据在其上登顶。属第三方评测环境具体评测维度原文未展开。RoboCasa一句话斯坦福等机构做的家庭场景机器人操作基准测试。 准确定义本文提到无界动力的 MWA™ 隐空间世界模型在其榜单上超越英伟达 GR00T-N1.6。属第三方基准。Sim-to-Real Gap一句话在模拟器里学会的本事搬到真机上经常失灵。 准确定义仿真环境与真实物理世界在视觉外观、材质属性、接触动力学、传感器噪声等方面的系统性偏差。本文的定位是仿真更适合做预验证和补充增强但担不起主力数据的角色。复购率 /ROI≥ 30% /经营性现金流本文的三个落地指标一句话别看融资新闻看客户会不会再来买、省下的人力能不能算得清、钱有没有真到手。 准确定义宇泛智能 CFO 戴恺提出的三个衡量具身智能公司落地质量的指标分别对应客户黏性、投资回报可量化程度、以及收入质量是否有真实现金流入而非挂账应收。四、数字速查表数字含义口径与我的核对1015 元一条 30 秒真机操作数据的采集成本受访方行业估算原文未附独立来源约 1000 元采集 1 小时的折算成本同上2 亿元以上凑够 20 万小时的成本基于上两项的推算非实测100 万小时以上V-JEPA 训练所用视频量Meta团队论文口径原文未注出处需回原文确认1000 小时智在无界 Being-H0 用的人类第一人称视频量2025-07公司披露近 2 万小时Being-H0.5 规模2026-01公司披露20 万小时Being-H0.7 规模2026-04/05公司披露13 万小时英伟达 EgoScaleDreamDojo 使用的人类视频量公司公开资料原文表述为分别使用 1 到 3 万小时不等近 10 万小时灵初智能 Psi-R2 的训练数据规模公司披露27 万小时Generalist GEN-0 训练数据量厂商自述。官方博客发布 2025-11-04首次观察到机器人领域 Scaling Law为中文媒体转述口径62 自由度灵初智能外骨骼触觉手套的自由度公司披露自由度指可独立测量的关节运动维度亚毫米级该手套的采集精度公司披露4000 小时 GPU50 小时数据用显式世界模型训练所需的算力受访方自报无第三方验证1/80隐式相对显式的成本比受访方自报千亿级扩展到 20 万小时时显式路线的推算投入受访方推算非实测35 年2B 比 2C 快的时间差行业共识性质判断原文称一个基本共识正在形成30%ROI 门槛替代人效的可量化提升宇泛智能CFO提出的标准非行业统计约 460 亿元2026 上半年具身智能融资额媒体统计钛媒体 2026-06、投资界 2026-06。⚠️ 另有900 亿口径中证报等2026-07-10差异未说明引用需择一并标源170 亿 / 70%早期轮次金额其中集中在头部 10 家的比例媒体统计口径同 460 亿10 万小时 → 约 5417 小时灵初智能采集的人类数据量 → 筛出的真机等效数据量公司披露。折算比例约5.4%是全文最能说明量不等于质的数字2 年云松鼠智能黄骏达预测五指灵巧手收敛的时间个人判断属最激进的一档看法五、我的追问1. 全文最有价值的一句话其实没有对照实验撑腰。10 万小时可能不如 1000 小时——陈源培给的是差不多等效的定性比较没有公开的对照实验数据。如果这个结论成立它意味着当前数据管线的有效信息密度低到惊人那么优化管线的边际收益会远高于扩大采集。这是个如果为真就足以改变行业资源配置的判断值得追后续有没有论文或评测把它做实。2. 论证链条里有一个明显的缺席人类数据自己的成本账。文章开头用真机遥操的成本30 秒 1015 元、20 万小时 2 亿元证明了真机路走不通。但整个论证的落点是人类数据更便宜这个替代方案自己的成本却从头到尾没有给数字62 自由度外骨骼触觉手套一套多少钱采 10 万小时要多少人、多少套设备、多长时间换算到每有效小时的成本是多少这是本篇最关键的论证缺口。没有这个数字人类数据更便宜就还是定性判断。3. 第 9 节和第 1 节其实在打自己的脸——但这是个健康的打脸。第 1 节的逻辑是成本太高 → 撑不起 Scaling第 9 节却告诉你就算把 10 万小时摆在面前筛完只剩 5417 小时约 5.4%能用。这两个事实叠加起来的含义是真正的成本瓶颈不只在采集端更在处理端的转化效率。如果转化率只有 5%那么采集成本 × 20才是真实的数据成本。原文把这两件事放在同一篇里但没有把它们乘起来——这是我认为读者可以自己往前推一步的地方。4. 稀缺的是精准 3D 位姿这个排序和第 10 篇的观察正好对上。陈源培给的感知模态优先级是**精准 3D 位姿 触觉模态 2D 图像特征。而第 10 篇知乎2024 年 12 月在盘点学术界数据集时指出最稀缺的三样正是末端力传感器、Depth 信息和手眼标定位姿。两篇相隔约一年半、立场和体裁完全不同却在缺什么上高度一致。**这种独立信源的收敛比任何单篇的论断都更可信。5. 宇树的分歧是今天最有意思的未定论。高天垚说宇树二级市场千亿问题不大戴恺说它大脑层面的投入还没有到那么高的层面、估值会趋于理性范永说未来三五年能跑营收的更可能是本体企业因为大脑要附生到本体。三个判断互相不完全兼容而且分别来自投资人、产业 CFO、本体创业者——立场各自成立。宇树 IPO 之后的表现会是检验哪一方判断更准的第一个公开样本。6. 一个需要打问号的转述。据灵初智能方面透露OpenAI、英伟达、Meta 等也在大规模采购人类数据——这条没有出处、没有数字、无法核实且来自利益相关方灵初自己就在卖人类数据采集方案。文中其他引用多数能对上人这一条属于最弱的一环建议标记为传闻。六、原文原文入口标题《具身智能的真机数采到了分水岭》来源钛媒体 APPAGI-Signal 出品作者AGI-Signal编辑秦聪慧发布时间2026-07-17 11:06链接https://www.tmtpost.com/8068523.html关键摘录以下为原文引语已标注出处仅作评述引用看来看去唯一一个能够 Scaling 的数据其实就是人类数据。——灵初智能技术负责人陈源培10 万小时的人类数据有些时候可能还不如 1000 个小时。——同上就像英伟达的算力基座如果没有 CUDA 生态再好的 GPU 也用不起来。数据同理缺的不仅是数据更是整套的工具链和测评体系。——无问智科创始人刘盛翔人形机器人现在就是一个 3 岁的小孩不要指望他现在去打工挣钱。但如果你相信他是个健康的孩子他一定能长到 18 岁。——优宝特机器人创始人范永如果你看现在市场上很多具身智能公司他有收入但其实全在应收帐款上过一段时间可能又要归集为坏帐。——宇泛智能 CFO 戴恺不是三到五年更不是五到十年未来两年内就能见分晓。——云松鼠智能创始人黄骏达谈五指灵巧手的收敛速度每一个环节在单次执行时都没有问题但全部堆上去放量的时候每个地方都是卡点。——陈源培谈数据管线版权提示以上仅为短句评述性引用请勿转贴原文全文如需引用请回到原链接并注明出处。七、延伸阅读与横向关系与本批三篇的关系第 8 篇36 氪第 9 篇本篇第 10 篇知乎体裁产业媒体评论带厂商案例深度访谈 行业观察技术综述博客时间约 2025 年末2026 年初2026-07-172024-12-232025-01-17 更新角色问题清单现场访谈主样本技术底图主要信源灵巧智能外骨骼灵初智能、智在无界、无问智科、宇泛、优宝特、云松鼠、联想之星等学术论文 特斯拉PI智元公开资料回答缺什么数据缺灵巧手末端操作数据任务多样性 物体多样性 场景多样性精准 3D 位姿 触觉 2D 特征末端力传感器、Depth、手眼标定位姿最稀缺回答谁会成为主流协同论设备互补不取代分工论人类数据占预训练、真机退到精细微调记录 2024 年答案机械臂遥操数据质量最高三条主线与第 8 篇共用此处只补充本篇特有的观察主线一补充两年内答案翻转的完整证据链本篇提供得最完整。第 10 篇2024 年 12 月记的是机械臂遥操数据质量最高Physical Intelligence 明确不采用仿真与视频数据。第 9 篇2026 年 7 月记的是人类数据在预训练层面成为主流真机数据退到精细微调。中间的关键转折点在本篇的时间线里非常清楚——2026 年 2 到 3 月英伟达发布 EgoScale 与 DreamDojo被作者点名为关键的验证信号。记住这个时间节点它很可能是将来回看这段历史时的分水岭。主线二补充采集容易消化难这条线本篇给了最硬的证据。第 9 节的三个事实组成一条完整链条数据管线在放量时每个地方都是卡点 → 10 万小时筛完只剩约 5417 小时 → 而无问智科说就算有一千万小时也可能用不起来。三篇各自独立指向瓶颈在消化端这是本批材料里最可靠的结论。主线三补充本批的信源已经在本篇得到部分平衡。第 8 篇的案例方和本篇的主要访谈对象都偏外骨骼路线。本篇额外的价值是它同时引了纯视觉路线智在无界郑思鹏和传统路线智元、宇树还引了投资方联想之星高天垚和本体创业者范永的不同判断。金句密度最高的是外骨骼阵营但分歧本身也被完整保留了——这是本篇写作上比第 8 篇更扎实的地方。需要后续核实的事项10 万小时不如 1000 小时的对照实验—— 目前只是定性说法建议追踪灵初智能是否有后续论文或评测发布。人类数据采集自身的成本—— 外骨骼手套单价、单位有效小时成本本篇完全缺失是最大的论证缺口。OpenAI英伟达Meta大规模采购人类数据—— 单方转述、无出处、来源方有利益相关建议按传闻处理。460 亿 vs 900 亿两个融资口径—— 需确认统计范围差异对外引用必须择一并标源。V-JEPA 的100 万小时以上视频—— 回 Meta 原论文确认口径是训练数据总量还是某一阶段。RoboCasa 榜单上 MWA™ 超越 GR00T-N1.6—— 建议核对榜单快照日期榜单排名具有时效性。MolmoSpaces 的评测维度—— 原文未展开Psi-R2登顶的具体项目需回原榜确认。
返回列表