机器人数据争夺升温,Innodata 开设动作捕捉实验室
Innodata 于 9 月 30 日表示,已在新泽西州开设一家动作捕捉实验室,为人形机器人和工业机器人生成训练数据。公司押注直接进行 3D 捕捉,认为这比从 2D 视频推断动作更可靠。

这家数据工程公司总部位于新泽西州里奇菲尔德帕克,周三宣布实验室投入运营。实验室配备 Vicon 的红外光学追踪摄像头,Innodata 称这些设备能测出亚毫米级的动作。公司说,每个机器人团队都会撞上一个瓶颈:真实世界的交互数据不够,而现有的数据既贵又慢。这处设施就是冲着这个瓶颈来的。
“物理 AI 的增长快过 AI 的任何其他细分领域,但每个机器人团队都撞在同一堵墙上,”Innodata 首席执行官 Rahul Singhal 在《机器人报告》刊载的一份声明中说。“这处设施把那堵墙拆掉了。”
这一宣布赶上了机器人数据新闻扎堆的一周。同一天,TechCrunch 报道物流机器人初创公司 Destro AI 结束隐身状态,完成 800 万美元种子轮融资。它的核心是一套智能层,同时告诉人类工人该做什么。同样在 9 月 30 日,MindOn 公布了 Mind-1 的细节,称这款物理 AI 模型把机器人推理延迟从 82ms 降到 32ms。Fig Inc. 则发布技术报告,显示包括 Astra 和 Opus 5.5 在内的前沿模型在机器人任务和网页任务上表现参差。
为什么要直接捕捉
Innodata 的理由是技术性的。公司称,多数数据供应商通过分析 2D 视频来推断 3D 动作,而 Innodata 直接从人体或机械本体上采集 3D 数据。
“直接的动作捕捉无可替代,”Innodata 机器人与物理 AI 副总裁 Franklin Tanner 对《机器人报告》说。“当计算机视觉模型试图理解一片 2D 像素网格时,错误总会悄悄混进来。”
Tanner 举了机器人拿杯子的例子。多数人抓杯柄,但抓杯身也行。如果杯子里是热水,这个差别就重要了。“语境很重要,而即便现在已有的数据集里,这一点也并不总是被记录下来,”他说。
Innodata 称,实验室将采集人形机器人、遥操作硬件、可穿戴系统、传感器支架、Universal Manipulator Interface 夹爪以及其他多模态设备的动作数据。这些数据随后可以喂给数字孪生,用来生成边缘案例。公司还说,该设施会独立验证机器人自身生成的性能数据,并把这项服务打包成从采集到模型评估的端到端方案。
规模问题确实存在。Tanner 指出,一台接近 200 磅的人形机器人需要精确读数,而不是“大概差不多”。他还点出一个缺口:“我们现在没有人类和机器人互动的训练数据。这是实验室正在攻关的方向之一。”
竞争对手也在搭建数据层
周二结束隐身状态的 Destro AI 走的是另一条路。它不做机器人,而是做一套智能层,在物流场景里协调机器人和人。其创始人 Manthan Pawar 对 TechCrunch 说,公司能赢过机器人公司,“因为我们自己不是机器人公司”。
Destro 的第一个试点在太平洋西北地区的一家邮船物流(Yusen Logistics)设施里展开,使用 Miva Robotics 制造的三台推车机器人,由 Destro 基于开放权重视觉语言动作模型的 Vision 操作系统操控。人类工人把货物从一辆卡车上卸到推车里,机器人找到装满的推车再运走。Yusen 所属美国物流集团负责自动化的总监 Richard Brunelle 对 TechCrunch 说,另外两家知名机器人初创公司都适配不了这套流程。一家只能做点到点的推车搬运,不能装卸;另一家需要有人来协调调度。
Destro 正把这个试点扩大到 26 台机器人,并在南加州的一处 Yusen 设施启动另一个 17 台机器人的项目。种子轮由 Base10 Partners 和 Bonfire Ventures 领投,CoFound Partners 参投。
MindOn 的 Mind-1 针对的是另一个约束:速度。在 9 月 30 日发布的博客文章中,公司称该模型让机器人在某些任务上达到人类的循环时间,甚至比人干得更快。文章列出高速操作的四个障碍:用遥操作采集的训练数据比人类自然动作慢;速度快时推理延迟会叠加;连续的推理步骤可能产生不一致的轨迹意图;控制与传感器的同步要求随之上升。
“末端执行器速度为 3 m/s 时,仅仅 10 ms 的延迟就对应大约 3 cm 的位移,”公司写道,这足以影响精确抓取或插入。MindOn 称,Mind-1 的训练数据来自人在自然速度下完成任务时的直接采集,并以人为中心;模型把推理延迟从 82ms 降到 32ms。
基准测试掩盖了参差不齐
研究机构 Fig Inc. 于 9 月 30 日发布技术报告,认为头条基准分数掩盖了前沿模型表现的巨大不均衡。团队在 VisualWebArena 上评测了七个模型,这是一个包含 177 项任务的闭环网页任务基准;又跨四个离线物理领域评测了三个模型:VLABench、Assembly101、IndEgo 和 Bench2Drive。
他们的发现是:在任意两个模型之间,较弱的那个总能解出至少一项较强模型没解出的任务。一次模型更新可能让平均分几乎不变,而大量单项任务的结果却发生翻转。同样的参差也出现在物理领域。在每一项领域平均分上都胜过 Gemini 3.5-Flash 的模型,在某些任务类别上仍然更差。作者发布了 RIDGE,一个包含逐项结果和模型轨迹的数据集。
这对任何购买机器人数据或模型的人都很重要。单个基准数字几乎不能告诉部署团队,这个模型在自家特定的任务组合上是否管用。
数据生意遇上炒作周期
Innodata 开设实验室,是在押注真正的约束是数据而非硬件。公司成立于 1988 年,自称提供数据、评估框架和人类专业知识来服务 AI 系统。它进军机器人领域符合一个更大的模式:随着人形机器人和物流机器人公司拿到大额融资,向它们出售训练数据、仿真和评估工具的厂商正把自己定位成卖铲子的角色。
这个市场会不会像机器人厂商希望的那样快速增长,尚未得到验证。Tanner 把仿真视为一个杠杆。“仿真器在拿真实世界数据、做真到仿的转换、再对环境做排列组合方面已经相当不错了,”他说,并点名英伟达的 Cosmos 环境“在这方面真的越来越好”。但他补充说,真实世界数据仍是黄金标准,而且很贵。
还有人才和注意力的问题。OpenCat、Nybble 和 Bittle 背后的制作者 Rongzhong Li 于 9 月 30 日在 Hackster.io 上写道,他的公司自 2018 年以来已出货 3 万多台四足机器人。他担心的不是数据量,而是产品交付。“人们开始抱怨机器人只会跳舞或跑得快,却不干活,”他写道。他认为高自由度机器人能带来情感连接,但也抬高了下一个制作者的门槛,降低了任何东西能作为可靠产品出货的概率。
他为商用机器人提出的信号要安静得多:把一台令人印象深刻的机器人在交付几个月后的二手价格与其物料清单成本作比较。这两个数字都不能反映全部价值,但他写道,二者之间的关系可以揭示在新奇感消退后,市场还看到了多少实际价值。他的第三款产品 Quaddle 正在 Kickstarter 上众筹,起价 99 美元。
对 Innodata 来说,眼前的考验是机器人厂商是否愿意为外部采集并验证的动作数据付费,而不是自建捕捉能力。公司称其传感器能记录每个关节最微小的动作,让训练更准确、更高效。Tanner 的杯子例子就是这套推销的缩影:抓杯身而不是杯柄的机器人也许能完成任务,但也可能烫到端杯子的那只手。把这种语境编码下来,正是实验室要卖的东西。
《机器人报告》的母公司 Arrowfly 也在 9 月 30 日推出 AI for Engineers,这是一个包含新闻编辑部、定于 2027 年 9 月 20 日至 22 日在内华达州亨德森举行的年度会议、原创研究和顾问委员会的平台。Arrowfly 称其工程类品牌触达 210 万经过验证的行业读者。这次上线是又一个信号:面向机器人的 AI 信息市场正随硬件一同扩张。
这一周的公告共享同一个前提:机器人进步得足够快,约束已经转移到数据、编排和速度上。Innodata 押注捕捉,Destro 押注协调,MindOn 押注延迟,Fig 押注买家应当越过平均分看问题。它们都没有公布对其说法的独立验证,而能证明这个市场的机器人部署仍以几十台计,不是几千台。
资料来源
6- 01Innodata opens motion-capture lab to help humanoids move more like peopleEN
- 02Destro AI's secret sauce is getting robots and humans on the same pageEN
- 03Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 04Astra, Opus 5.5, and other Frontier Models Demonstrate Jagged Performance Across SoTA Agentic Tasks from Web Browsing to RoboticsEN
- 05What 30,000 robot dogs taught me about degrees of freedom and shipping a real robot productEN
- 06The Robot Report parent Arrowfly launches AI for Engineers platform, events for engineers navigating AIEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。