日薪250元的数采员,撑起150亿的独角兽

CN
27 分鐘前

机器人还没学会赚钱,卖数据的先上岸了。

图片

作者 黎曼

本文字数4685

手搓量丨98%   AI含量丨2%

淘金热里,最先富起来的总是卖铲子的,这一轮也不意外。

2026年最热的赛道莫过于Physical AI,不少公司也把它当作抬估值的叙事。在这一背景下,行业出现了一种不多见的“倒挂”:本体厂商还在为量产爬坡挣扎,数据服务商的估值已经站上了独角兽线。

这种“倒挂”不是个案。光轮智能2026年6月估值突破150亿元,成为全球首个具身数据独角兽;灵初智能于2026年8月估值迈入百亿元级别。另外,觅蜂科技成立十天就拿到数亿元融资。

一位把国内数采公司的帐翻过一遍的投资人Y曾得出一个结论:数采可能是这条赛道里唯一先跑通商业模式的生意。但这个结论,他几个月后自己推翻了,这是后话。

近期我还听到了两个故事,可以给具身数据赛道添两个注脚:

一家做硬件数采的公司跑通了一条新路线。消息传出去没多久,三五家同行围了上来:挖人的挖人,模仿路线的模仿路线,融资一家比一家快,都想赶在窗口关闭之前把护城河砌起来。

另一家做数据合成的公司,2026年之前无人问津。到了今年,当初那些机构的电话一个个打了回来:接洽,尽调,报价,估值翻了一倍。苦熬多年,被Physical AI这把火一点,忽然成了香饽饽。

一个被围猎,一个被踏破门槛。两条路线,同一种待遇。这大致就是具身数据行业2026年的体感:热,而且是不分路线地热。

钱来得有多急?

先看钱的量级。

2026年到现在,机器人赛道的总融资超过345亿元,其中砸向数据采集领域的超过100亿。如果把仿真合成类的公司也算进来,具身数据这个大盘子在今年上半年就吸走了约170亿元,融资事件25起。

翻开头部数采公司的名单,会发现一个事实:这些头部公司里,大量企业成立于2024年之后,有几家成立还不到一年,但大多数公司融资轮次停留在A轮之前。

轮次早,但不妨碍金额大。与具身数据相关的企业单轮融资超过10亿元的有4家:它石智航、光轮智能、千寻智能、灵初智能。平均算下来,每家的累计融资都在10亿量级。这些数字放在具身赛道早已见怪不怪。在场内下注的也不只是市场化VC,热闹是全维度的:本体在投,国家级基金、地方政府、国资基金也都在投。

与融资同时公布的还包括大订单。比如光轮智能2026年一季度新增订单5.5亿元;灵御智能披露意向订单3亿元、在手订单1亿元,全年预计出货1000台机器。

钱为什么这么急?这来源于一个确定性需求:数据荒。

机器人大模型是否遵循LLM式的Scaling Law,这件事在2026年2月之前还只是信仰。但EgoScale论文已经把它变成了实证:数据规模与任务能力之间,存在可测算的幂律关系。大模型缺数据,机器人更缺数据。互联网上有万亿级token的文本语料,而机器人可用的真实物理交互数据,全球加起来只有约50万小时,缺口99%。

缺口就是市场。这个市场如今挤进了近百个玩家,其中七成在做采集,同一种抓取、分拣、开门的数据,人人都在采,因为最好标注、也最容易商业化,招聘市场还带火了一批“日薪250元”的宝妈数采员。

目前,做数据的服务商大致可以分为三类:

一是本体公司自己下场做数据,典型玩家包括智元、千寻智能、优必选等。其优势在于本体公司可以用硬件反哺数据、绑定生态。

二是独立数据服务商,从零起步、没有机器人包袱,专注做“卖水人”。光轮智能是这一类最出名的玩家。他们采集的同一份高质量数据,可以卖给多家客户,数据资产可反复变现。

三是互联网大厂亲自下场圈数据,动静最大的是京东和百度,大厂的优势在于它的人力成本是固定支出,采集的边际成本接近于零,未来可能会对独立数据服务商的定价权形成长期压制。

也就是说,2026年的具身数据赛道,至少有三路人马在同台竞技,每条路线都有自己的逻辑闭环,都拿着不菲的融资。

单看上面这几组数字,都会认为这是一个完美赛道:产品供不应求,客户排队下单,融资节奏顺滑。既然机器人被普遍认为是下一个iPhone时刻,数据就是这条产业链上最早兑现的现金流,这个推理听起来无懈可击。

数采只有资本在赚钱?

但最近一则新闻也揭开了这条火热赛道的裂缝:

8月28日,南方都市报报道,位于北京石景山区首钢园的北京首个人形机器人数据训练中心已停止运营,原合作方机器人公司睿尔曼智能因数据采集模式调整已从该项目中撤出。该中心于2025年3月揭牌,占地面积3000平方米,曾部署100多台机器人,搭建了家庭康养、特种作业、汽车装配等十大实景场景。

运营方解释停运原因之一在于数据采集模式调整了。因素之一是实验室遥操采集的数据“太干净”,无法覆盖真实世界中光线干扰、物料偏差、场地不平、工况异常等不可预知的物理变量。

“近期,越来越多的实采数据工厂开始停运。原因在于:一,成本太高;二,数据不好用。”Y向我进一步解释:

成本高在于,一套数采工厂的硬投入包括设备、operator薪酬和场地三项,真机遥操数据单有效小时成本在500-1000元区间,无本体数据也要200-400元,加上设备折旧和人员管理费,没有规模化订单摊薄,工厂很难自负盈亏。

数据不好用是因为大量采集集中在抓取、分拣、开门这几类最易标注的场景,结构高度同质;而真机数据又强绑定特定本体,换一台机器人就要重新训练,模型公司买回去常常发现能看不能用。

年初,Y以为数采是目前短期内具身赛道唯一跑通商业模式的生意。但经过几个月的了解,还把国内几家数采公司的账翻出来算了一遍,“被打脸得挺明显”。不过Y同时承认,光轮的高复售率、觅蜂拿到了腾讯和蚂蚁的订单,这也说明头部公司已经跑出了可复制的商业模式,问题更多出在头部以下。

一位数采行业人士F向我透露,行业订单虽然在变多,但也存在一些虚实差距。比如,签约订单对应的真实收入大概在1到2亿元的量级,其余是分批执行的合同额度。一些公司的订单,看起来金额大,但其实是意向订单,有的转化率在一至三成不等。

大额资金涌入头部企业,但细看,头部数采公司里,3家背后站的是同一批机器人本体公司:

智元机器人投了灵初智能的种子轮;智域基石的天使轮来自灵初智能、穹彻智能、浙江人形、智平方4家机器人公司,这四家不仅是投资人,也是它的首批客户;觅蜂科技是智元自己孵化的,从成立之初就带着智元的资源与订单起跑。

翻译过来就是,上下游在互相“投资”自己。机器人本体公司缺数据,然后自己投资或孵化数采公司,让这家数采公司为自己供货。数采公司拿到融资之后,用本体公司的钱去建数采工厂、招operator、买设备,然后把采集出来的数据卖回给本体公司。

“表面上是两家公司都在增长,实际上是同一批钱在两家资产负债表上算了两遍。这种左手投右手的格局,当然有资本腾挪的色彩,但客观上也让一批数采公司在2025年没融到钱的年份里活了下来。订单有了,硬件投入有人分担,数据也有了第一笔买家。换到今天再看,这套打法至少支撑了2026年上半年的产能扩张。”Y观察道。

那么这一圈绕下来,到底谁赚到了钱?

“数下来可能是赚估值倍数的早期股东;套现部分股权的创始人;赚设备、场地、人力生意的配套服务商;本体厂商的投资收益;BD、Pr甚至宝妈数采员都赚到钱了,而数采公司自己,暂时是这条链上干活最重、离钱较远的一环。”F感叹。

但实际上,这条名单里的每一个人都是这场盛宴的实际受益者,但别忘了买单的最终是机器人本体厂商和背后的VC。他们愿意持续买单的前提只有一个:机器人要能学会干活。

“每个篮子里都得有鸡蛋”

了解一圈具身数据现状后,我得到了一个结论:这是一个有确定性需求、但供给不确定、商业模式头部跑通整体未通的赛道。

供给侧的不确定,根源在技术路线还没收敛。打开任何一家具身数据公司的产品手册,能看到的分类至少有四个维度。

按数据来源分有人类第一视角视频、互联网公开视频、真机遥操作、部署日志回采、仿真合成。按采集方式分包括遥操、穿戴式采集、本体自采、众包采集。按硬件形态又分本体采集和无本体采集。按生成方式分包含真机数据和仿真合成数据两类。

这四类在任何一个行业研报里都能拉出长长一列,但落到2026年上半年的融资分布上,钱其实只压在了两个判断上:

一派押真机实采,代表玩家是觅蜂等,估值故事的核心是“机器人要学真本事就得喂真数据”。另一派押仿真合成,代表玩家是云道智能、智澄AI等,估值故事的核心是“真机数据又贵又慢,仿真能指数级放大规模”。两派都拿到了大钱,也都有人在2026年新晋独角兽。

但现在有个新趋势:2025年之前,具身大模型训练数据中仿真合成数据占比高达80%到90%;到2026年,“人类数据”的浓度和认可度明显提升,头部也开始朝双路线布局,比如光轮从仿真起家,现在是双线并行。背后的一大原因是,一个在仿真环境里做到89%成功率的策略,落到真机上只剩12%。

针对行业现状,我询问了一家在仿真赛道扎根12年的企业,云道智能。今年,这家公司向具身数据拓展,目前已和不少本体公司合作。

云道智能方面认为:它揭示的方向是对的。越接近开放环境、越依赖接触和长链路决策,虚实差距就越大。摩擦、间隙、材料形变、末端执行器特性、电机迟滞,再叠加相机角度、光照和现场物料波动,都会影响结果。“我们看到的不是仿真变弱,而是行业从‘先解决规模’,进入‘必须由真实世界锚定规模’的阶段”。

云道智能认为,仿真的核心不是规模大,而是分布广。因此真机和仿真不是替代关系,是分工。“现在真正的瓶颈在跨本体、跨场景的泛化能力,而这个行业至今没有独立可复核的误差基准,仿真数据的质量验证,还没有公共答案。”

投资方云道资本创始人曹稷山认为,“合成数据路线,理想状态下公司很值钱,但业界早期看法并不特别乐观;仍需足够多客户与订单验证可行性。立意可以很高,关键是能否被验证。”他也强调,数据会贬值,会变老,持续生产数据的能力比数据本身值钱;只卖数据、离客户太远的公司,拿不到反馈,数据资产会老化。

“数采平台一定会出现很牛的公司。”曹稷山认为,路径上,软硬件解决方案比纯数据更有机会,硬件有技术壁垒再往上走,往往更容易,可能得掐住6到12个月的窗口。但最终必须有头部客户交付能力,要做Tier 1,不能长期做分包商。

曹稷山看好数采平台的长期价值,他的逻辑锚点是一笔重磅交易:2025年年中,数据标注巨头Scale AI“卖身”Meta,这证明数据公司可以讲出一个独立的资本故事。

但Scale AI这个锚点本身也值得多想一层。一家公司从标注起家,如果最终归宿是被大模型巨头或者本体收编的话,是不是意味着目前的商业模式还没有到能够独立IPO的时刻?

虽然路线还未收敛,但都得到大家一致认同的观点是:堆量不赚钱。

“单纯靠人工采集堆小时数,容易变成重资产、项目制服务;真正有长期价值的是把真实数据、仿真生成、模型评测和部署反馈连成闭环。”云道智能认为,未来,行业接下来至少要过三关:

第一,数据是否标准化:格式、标注、物理参数、质量评价、来源合规和可追溯性,能否形成共同语言;第二,数据是否真正有效:能不能在真实机器人上提升成功率、降低调试周期和试错成本;第三,商业模式是否成立:数据能否跨客户、跨任务、跨本体复用,能否从一次性项目交付变成持续的训练、评测和部署反馈服务。

但另有“算法派”投资人告诉我:具身破局的关键不是数据,也不是传感器,而是世界模型。他认为具身的瓶颈卡在“大脑”,谁能做出好的世界模型谁赢。他认为短期可量化的验证指标只有一个:scaling十倍。现在头部世界模型在70亿到100亿参数,“谁能把它后边加一个零,谁就在短期跑出来”。

行业种种,目前皆在动态演变,未分出绝对胜负。但淘金的“铲子”已经在一级市场卖出了金子的价,这笔账的答案,恐怕要等到2027年来揭晓。

今年,我从不少于2位有真才实学的VC和从业者那里得到一个比较清晰的判断:具身的GPT时刻大概率会在2027年上半年到来。也就是说,在这之前,这个赛道正在迎接前所未有的压力测试。

而2026年至今发生的大额融资数据,与其说是一级市场选出了路线,不如说市场对每一条能讲清稀缺故事的路线都下了注。VC不是在押哪一派对,是在确保自己不缺席可能对的那一派。所有人都记得大模型时代踏空的感觉,所以这一次,每个篮子里都得有鸡蛋。

作者黎曼 编辑王庆武

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接