新闻
录制
机器人还没上岗,谁在收千万级“培训费”?
配图:机器人还没上岗,谁在收千万级“培训费”?
新闻导读
机器人还没上岗,谁在收千万级“培训费”?汛期气象科普及时,讲清预警含义和个人应对,不靠恐慌留人。音频可后台播放,图文可细读,双形态互补。很多生活现象背后的原理讲得清楚,不装腔作势,也不故意卖萌到尴尬。图示和类比都挺到位,读完往往能记住核心观点,而不是只剩“好神奇”。压力小,收获却一点都不含糊,适合建立科学思维。整体我愿意长期留着,慢慢看、慢慢补。
8月12日,具身智能数据基础设施公司元点科技披露,40天内完成两轮融资。相比融资速度,更值得注意的是它拿到的第一批生意——已经启动的它石智航千万级数据订单。
这笔钱购买的不是一批已经装进硬盘、按小时计价的数据,而是一套围绕真实任务展开的服务。元点科技负责定向场景数据采集,再通过MatrixOS平台处理,相关服务被用于支持它石智航A系列机器人进入安波福工厂的多个作业场景。
具身智能行业过去几年一直在说数据重要,问题是,相比于大语言模型可以从互联网上读完人类留下的大量文字和图片,机器人要理解的却是一个更麻烦的世界,很多经验没有现成语料,必须有人或者机器人在真实环境里做一遍,再将视觉、动作、关节状态、力觉和触觉记录下来。
这也是理解元点科技订单的关键。它石智航购买的不是若干TB的数据,而是让机器人更快学会一项工作的一段研发与交付流程。
这条流程从任务定义开始,经过场景采集、数据处理和模型训练,最终还要回到现场验证。机器人在哪里失败,就要补充哪里的经验,再进入下一轮训练。
因此,机器人数据并不像一批摆在货架上的标准商品,更接近一种仍在生产中的经验。数据公司也不只是帮忙“多录一些视频”,而是在回答机器人缺什么,哪些动作值得采,哪些数据能够进入训练,以及现场失败后应该补采什么。
理论上,本体公司离机器人最近,完全可以自己完成这些工作。事实上,很多头部公司也正在大规模自建数据采集体系。问题在于,当机器人要进入更多工厂、商场和家庭,数据生产会逐渐变成一种与造机器人不同的组织能力。
本体公司要研发硬件、控制系统和模型,要管理供应链,还要负责客户交付;数据生产则需要寻找场景、部署设备、组织采集、统一格式,再完成清洗、筛选和管理。前者更像制造一台机器人,后者越来越像经营一张分布式生产网络。
如果每进入一个新场景,本体公司都要从头组建采集团队,它很容易陷入无休止的项目交付。专业数据公司的机会,就来自这部分工作能否被工具化、平台化和规模化。
所以,数据生意早于机器人大规模上岗,并不矛盾。训练机器人如何工作,本来就可能比机器人真正工作更早成为一门生意。
建设数采场地、购买遥操作设备、招募操作人员、组织算法工程师清洗和训练,都会形成成本。但这些成本未必对应一家独立供应商、一份单独合同和一个公开价格。
8月4日,恺望数据宣布完成逾亿元战略融资。投资者名单中不只有产业基金和财务机构,还出现了鹿明机器人、松延动力、自变量机器人,以及智元旗下觅蜂科技等具身智能产业方。
媒体报道揭示了一部分答案。松延动力等产业方希望持续获得真实场景中的高质量数据,而恺望则在第一视角裸手、触觉手套、UMI夹爪、第三视角视频等数据品类上布局,并进入商超、餐饮、家庭和汽车工业产线等场景。
现有公开材料不能证明这些投资附带排他条款、数据优先权或特殊所有权安排,但是多家本体公司不约而同选择成为数据公司的股东,本身已经说明:数据正在从普通服务,变成机器人公司愿意提前绑定的上游能力。
有意思的是,机器人公司一直把数据视为自己的核心资产,现在却开始把其中一部分交给外部公司生产。其中缘由可能并不是数据不再核心,恰恰是它重要到不能只依赖临时搭建的内部团队。
当数据规模继续扩大,一套采集工具可以在不同场景重复部署,一套质量控制系统可以减少无效数据,一张场景网络可以服务多家公司。第三方公司只有把这些能力沉淀下来,才可能获得单一本体企业难以形成的规模效应。
而这也正是目前尚未得到证明的地方。一笔千万级定向服务订单,可以证明需求开始出现,却不能证明成熟的数据商品市场已经形成。
在「具身志」看来,判断这门生意能不能独立,关键不只是第一位客户愿意付多少钱,而是第二位客户能否从第一位客户的项目中受益。
如果每种机器人、每项任务、每个工厂都必须从头采集,所谓数据平台最终仍可能是一家项目公司。只有工具、流程、场景资源乃至部分数据能够跨项目复用,它才真正具有基础设施的雏形。
目前最直接的办法,是通过遥操作采集机器人动作数据。这类数据离执行最近,却受到设备、人力和本体差异的限制。另一批公司正在尝试从人类视频中扩大数据来源。
8月10日,DYNA Robotics发布DYNA-2。按照公司披露,这一模型使用超过100万小时的第一视角人类视频进行预训练,再用少量本地数据适配具体机器人。它试图证明,机器人不必完全依赖昂贵的遥操作数据,也能先从人类行为中学习大量物理经验。
虽然DYNA所发布的模型还需要更多外部验证,但它已经提出一个足以影响数据价格的问题。如果更便宜、更丰富的人类视频能够承担大部分预训练,昂贵的机器人动作数据可能只需要集中在最后的动作适配和现场优化。
与此同时,潜界科技正在研发的UTAM又把触觉、机器人状态和动作纳入统一训练链路。这意味着,今天只有视觉和动作的数据,未来也可能被认为不够完整。
人类视频、仿真数据、真实机器人数据和触觉数据未必互相替代,更可能分布在预训练、后训练和现场优化的不同阶段。但不同组合会直接改变每一种数据需要生产多少、应该卖多少钱。
它们确实有机会成为基础设施。多数本体公司都缺数据,而数据采集又重场景、重运营,假使第三方平台能够同时连接本体公司、模型公司和行业客户,就可能拥有更大的生产网络,并把采集设备、处理工具和场景成本摊薄到更多订单中。
但机器人数据也比文本和图片更难标准化。不同本体之间未必能够直接迁移,工厂数据可能涉及生产机密,头部公司可能坚持自建闭环,新模型还可能让某些昂贵数据迅速折旧。
判断一家机器人数据公司究竟是基础设施,还是高端项目外包商,不能只看它宣称拥有多少小时、多少节点或者多少TB数据。
真正重要的是三个结果:一份数据能否服务更多机器人,新增数据能否持续提高任务成功率,以及单位能力提升的成本能否不断下降。
哪怕十万小时数据也未必构成壁垒。如果它只能服务一个客户的一项任务,仍然只是一次项目交付。相反,即使数据量没有那么惊人,只要它能反复帮助机器人缩短调试时间、提高任务成功率、进入更多客户现场,就开始拥有基础设施的价值。
元点科技的千万级订单还不足以证明一个成熟市场已经形成,但它至少记录了一个产业变化:在机器人能够大规模出售自己的劳动以前,机器人公司已经开始为它们学习劳动支付费用。
未来真正决定数据价格的,不会是采集了多少小时、保存了多少TB,而是这些数据能够让机器人少调试多少天、多完成多少任务、多进入多少真实客户现场。
网友观点
离线包下载后出去也能看,信号差的地方不至于断档。语言通俗,但没有把科学讲成尴尬段子,分寸拿得住。大话题能串成小课,读完有脉络,不是散落的信息碎片。字号行距可调,夜间模式护眼,长时间阅读相对不累。安全的求知环境,有时比号称完备的知识库更珍贵。
免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://feiy.org/?id=hbv8t2-kgaivs


评论区
热门讨论 · 占位展示期待你的精彩发言。