2026具身数据创业潮:五大流派逐鹿,需求端刚性待考!
未解难题:机器人行业的数据荒漠
大语言模型爆发是因互联网有海量语料,但训练机器人靠的是拿、放、走、抓、拧、颠勺等三维物理动作数据,这类数据在互联网几乎不存在,具身数据匮乏是行业大瓶颈。Grand View Research预计全球数据采集与标注市场2030年将达171亿美元。
目前行业公认具身数据呈金字塔结构:塔尖是真机数据,质量可靠、可直接部署,但价格最贵;中层是仿真合成数据+UMI数据,成本适中、可无限量产,但存在Sim - to - Real鸿沟(摩擦/形变近似偏差);塔底是互联网视频和人类行为数据,来源广,但缺乏交互细节、信息稀疏。每层都有公司专注,这是理解当下具身数据创业潮的坐标系。
五大流派,三十多家公司全景
真机遥操/触觉派——把数据当成流水线来做
此流派逻辑朴素:建厂房、摆机器人、铺动捕设备,流水线量产高精度数据。帕西尼感知最为激进,其触觉传感器出货量全球第一,2025年在天津建成全球最大具身数据采集工厂Super EID Factory,年产2亿条数据;3月完成超10亿元B轮融资、估值破百亿后,又宣布在宿迁、武汉、自贡、赣州再建四座超级数据工厂。
动捕老兵是该线另一分支,诺亦腾机器人创始人戴若犁曾将诺亦腾科技做到全球专业动捕市场70%份额,后创办诺亦腾机器人,6月完成数亿元Pre - A++轮融资、估值约30亿元,北京、上海AI产业基金、深创投、中金、昆仑资本集体投资,并发布ModalityNet全模态数据平台。
青瞳视觉走开源换生态路线,5月发布全球最大规模1000小时人类高精度光学动捕开源数据集,预计年产50万小时,宇树科技春晚机器人武术首秀《武BOT》的武术数据采集就来自其Project Decode系统。灵生科技等触觉新秀也在抢占市场。
仿真合成派——在虚拟世界里“印”数据
若真实数据昂贵,能否在电脑里构建物理真实的虚拟世界批量“印刷”训练数据?这条路线诞生了全球首个具身数据独角兽光轮智能。今年3月它完成10亿元A++轮融资,5月获蚂蚁集团领投,6月再融资10亿元,投后估值超20亿美元(约合150亿元人民币)。光轮智能2025年营收增长10倍,2026年一季度新增订单5.5亿元,一个季度超去年全年。
跨维智能是“生成式仿真”代表,自研DexVerse仿真引擎在虚拟世界自动生成海量场景数据;今年7月官宣10亿元融资、估值超百亿并启动IPO,上半年营收1亿元,超1500套模型完成商业化交付。
上市公司中,今年4月登陆港股的“全球空间智能第一股”群核科技,正将3D云设计积累的海量三维场景数据拓展到具身智能领域。仿真平台松应科技2月、7月完成Pre - A及Pre - A+轮累计数亿元融资,与国家地方共建人形机器人创新中心共建合成数据集。
UMI无本体/便携采集派——绕开本体,“复刻”人
遥控机器人采集数据有缺陷,采集到的不是人的真实能力,而是妥协后的动作。于是这一派绕开本体,让人戴着手套、夹爪、穿戴设备直接操作。这是今年资本密度最高的路线。
6月1日,简智机器人官宣连续多轮共数亿元融资,由蚂蚁集团、滴滴、德联资本领投,顺为、BV百度风投跟投,这是无本体数据领域迄今最大规模融资。创始人陈建兴是前Momenta算法高级总监,公司成立一年,已覆盖上万处真实场景,还与蚂蚁灵波达成战略合作。
它石智航提出Human - centric数据采集范式,推出SenseHub穿戴式采集方案;4月完成4.55亿美元Pre - A轮融资,创中国具身智能最大单笔融资纪录,由高瓴、红杉、美团联合领投,并发起目标1亿小时的“具身数据星火计划”。
清华系鹿明机器人的FastUMI系统将数采效率提升三倍、成本降至五分之一,获三菱电机连续领投并拿下头部客户订单。智元机器人今年2月将数据业务分拆成独立公司觅蜂科技,仅十天就完成数亿元种子轮与天使轮,由红杉中国领投,计划2026年实现千万小时级数据产能。
更年轻的公司也在崛起,孵化自清华计算机系的星忆科技对标英伟达EgoScale路径,进行高自由度、毫米级精度的第一视角穿戴采集,已完成首轮融资并于7月获Pre - A轮;北大教授卢宗青的智在无界直接用互联网视频预训练通用动作模型。非夕孵化的穹彻智能靠“生产伴随式”数采系统CoMiner拿下近百套订单,6月再获数亿元融资,即将发布自研世界模型。
还有新公司渊澈太初(OriginFlow),采用NeuroScale范式,通过自研肌电采集套件捕捉人体肌肉收缩电信号,经PULSE基础模型编码重构手部姿态/发力/触觉反馈,对接“意图—肌肉—动作”原生传导链路,弥补UMI视觉遮挡失效、力触觉缺失局限。创立一年,公司已完成天使轮、战略轮+Pre - A1轮累计超5亿元融资,创始人秦深涛为00后清华博士、哈工大本科。
视频蒸馏/世界模型派——教AI“看懂”物理世界
此路线解决数据金字塔最底层“变废为宝”问题,互联网有大量人类操作视频,但缺少机器人所需力觉、触觉和三维轨迹信息,是“看得见却用不上”的死数据。
视频蒸馏派用算法从二维视频反推动作轨迹和物理交互信息,将死数据“蒸馏”成可训练的具身数据,成本可压到真机采集的千分之几。世界模型派更直接,让AI先掌握物理世界运行规律,再在“脑内”生成无限训练数据。
枢途科技的SynaData管线能从互联网视频批量提取手部轨迹、物体运动路径等多模态具身数据,综合数采成本极低,已获东方富海领投数千万元,数据被清华RDT、智元UniVLA等主流开源模型采用。
极佳视界用世界模型GigaWorld生成训练数据,使VLA模型在三大泛化维度上性能提升近300%,6月完成10亿元B+轮融资,3个月内累计融资35亿元。
深度机智押注人类第一视角视频数据,今年上半年融资三轮、数亿元+,5月份,深度机智Z - WM世界模型在WorldArena评测中登顶全球榜首。文章开头的LiberAI,也是这条路线与世界模型赛道的融合。
数据基础设施/平台派——是数据平台,也是“炼油厂”
这一派认为具身数据瓶颈不仅在“怎么采”,还在“怎么用”。各家机器人本体、传感器、数据格式不同,原始数据像成分混杂的原油,直接用于模型训练会越训越差,需要清洗、对齐、标注、评测,将原油炼成“标准汽油”。而且训练场、采集设备、动捕系统都是重资产,中小团队难以承担,所以需要建共享训练场、定数据标准、提供工具链和平台服务,无论哪种数据技术路线获胜,都要经过此环节。
无问智科依托虚实融合闭环的德清数据采集训练场,日产数据上千小时,4月完成超亿元融资,一季度签下字节跳动、无界动力等数亿元订单。弈人科技4月连续完成两轮亿元级融资,同时宣布2025年收入破亿并实现盈利,可能是赛道里首个宣布盈利的公司。
去年12月成立的智域基石专做数据清洗、对齐、治理的中游转化,灵初智能、穹彻、智平方等本体公司都投资了这家“上游”企业。上市公司玩家也进入市场,数据服务龙头海天瑞声携手北京石景山人形机器人数据训练中心共建“具身智能数据训练场”。大厂也纷纷入局,京东发布具身数据全链路基础设施,计划发动60万快递员、骑手众包采集,目标两年积累1000万小时真实场景视频;百度则打造“数据超市”。
冷静一下:数据需求端是刚性的吗?
2026年是具身数据规模化元年,截至2026年4月底,处于“使用或规划建设”状态的数采中心至少90个,其中已投入使用64个,其余在建/规划中。但风口越热,越需冷静思考。
具身数据生意有个未被点明的结构性问题:需求端和供给端资金来自同一批资本。买家大多是大模型团队、初创机器人公司、转型中的本体厂商,这些采购方多数未盈利,采购预算源于刚到账的融资款。
也就是说,数据公司营收本质是下游融资的二次分配:具身智能机器人公司融资后购买数据“讲故事”,故事讲得好再融下一轮。若机器人本体公司落地不及预期,数据订单和融资会同步减少,这是一荣俱荣、一损俱损的共生关系,是依附于下游的市场需求。
业内共识是,长期存活的具身数据公司大概率分两类:一类成为行业标准平台,掌握仿真、数据处理、评测等生态级工具;另一类具备跨厂商的数据融合与提纯能力,能在机器人进入真实场景后持续提供高质量、长尾的数据。