打工人当“AI老师”
2026年09月29日
字数:2280
真实场景数据掣肘人形机器人落地,当觅蜂科技以“觅蜂派”试水众包数采,“机器人训练师”行业有哪些机遇与挑战?
本报综合报道 随着具身智能产业加速走出实验室,走向各类真实作业场景,真实物理动作数据供给不足,正成为人形机器人落地绕不开的瓶颈。继海外Figure公司推出Index平台,付费征集真实任务视频用于模型训练之后,近日,觅蜂科技在上海发布“觅蜂派”具身智能数据众包采集平台。
平台面向全社会招募“机器人训练师”,各行各业普通人可在日常工作、生活中完成动作采集并获取报酬,把实操经验变成机器人训练的核心“教材”。
机器人从实验室走进真实工作间
过去三年,具身智能行业逐步从研发阶段迈入部署落地阶段。不过机器人要从实验室走向仓储、零售、家庭等真实环境,首先就要跨过真实世界数据短缺这道坎。
在此之前,行业普遍采用真机遥操模式采集数据,操作人员借助手柄、VR设备操控机器人完成任务示范。这套方式产出的数据与机器人本体匹配度较高,但产能受制于机器人数量、操作人员和场地等因素,一旦扩大规模,硬件、人力、运营等成本随之水涨船高,很难满足产业快速增长的数据需求。
行业内部逐步形成一套数据分工思路,简单概括为三类模式互补:无本体采集拓展场景规模,真机遥操输出适配机器人本体的数据,真实场景部署持续完成模型修正迭代。所谓“无本体采集”,即不需要绑定特定机器人硬件,只记录人类真实操作行为,并通过轨迹重建、动作转换等方式适配不同模型,觅蜂派正是顺应这一产业需求推出。
觅蜂派整套系统由自研MEgo数采设备、觅蜂派App、数据治理引擎MEgoEn⁃gine三部分组成。用户通过App领取任务,佩戴采集设备在现实场景完成指定操作,平台依据审核后的有效时长结算报酬。原始采集数据汇入MEgoEngine后,会经过处理、标注、质量评估等环节,将人的操作拆解为抓、拿、放、拧、按等120多种原子动作,通过位姿重建、动作映射,转化为模型可用的训练数据。
截至8月31日,第20000套MEgo采集设备已经下线,累计产出超过100万小时真实世界无本体数据。据觅蜂科技披露,觅蜂派目前覆盖了22大类场景、5000多个任务以及50000多个真实环境,涵盖物流、仓储、餐饮、养老、医疗、农业、非遗等多个赛道。
众包模式挖掘千行百业数据增量
有别于传统专职采集团队,觅蜂派把数据采集的触角延伸到普通劳动者身边。网约车从业者可以利用做家务间隙记录浇花、整理桌面;非遗手艺人能够录制揉制、包馅等手艺动作,把传统技艺转化为机器人可以学习的素材。普通参与者无需掌握编程、机器人专业知识,就能成为一名“机器人训练师”。
平台正式发布前已经完成一个月内测,内测期间注册用户达2万人,累计收到1.3万份采集任务。据现场实测发现,觅蜂派App上的设备租金定价为39元/天,发布会推广期内折扣价为19元/天。觅蜂派业务副总裁张智富表示,收取设备使用费的目的不为盈利,仅是设置一道门槛——如果设备免费发放,用户可能不会认真使用。后续平台或将根据采集者的有效时长和数据质量给予动态补贴,逐步降低活跃采集者的设备成本。
为扩大参与者激励,觅蜂派同步推出总规模超亿元补贴计划,具体包含5000万元任务补贴、2000万元设备补贴、3000万元线下服务网络建设投入以及200万元保险保障,并搭建M1至M5五级采集者成长体系。推广周期内,符合条件用户还可以享受信用免押政策。目前,觅蜂派已上线各大应用商店,在全国40座城市开展运营。
觅蜂科技董事长兼CEO姚卯青同时是智元机器人联合创始人。在他看来,百万小时的数据规模已经跟不上市场节奏,不少模型企业的数据需求已经来到数百万小时级别。产业瓶颈不只是数据总量,更在于场景丰富度。像家庭叠衣服这类场景的数据已经趋于饱和,但修水管、修车、理发这类专业技能场景,如果依靠专职团队拓展效率很低,众包模式恰好可以解决“场景进得去”这一难题。
不过,众包模式下如何管理大量分散的C端采集者,仍是一个开放问题。张智富坦言,众包C端用户的管理本身难度很大,对比外卖行业经过近十年迭代才建立起可靠的配套体系,觅蜂派的全链路体系仍在持续完善中。
质量管控仍是核心考题
众包模式能够快速做大数据产能,但数据质量始终是绕不开的行业考题。
姚卯青介绍,用户提交采集任务后,平台会在一天内完成自动化初筛,剔除无效数据;通过初筛的数据,还要再经过轨迹提取、人工抽检等多道工序。经过结算环节的数据,最终可用率超过95%。平台不会把数据简单分为“好”与“坏”“0”或“1”,而是按质量分级,匹配不同模型训练阶段的需求。
这里也存在一个行业共性争议:部分第一视角采集,会要求人放慢动作、固定流程,方便算法解析。可一旦人的动作刻意“迁就算法”,现实环境里的快速动作、物体遮挡、现场纠错、非标准化操作就会丢失,模型学习到的行为样本会被人为收窄,看似好处理的数据,实际训练价值反而打折扣。
针对这一痛点,觅蜂派从软硬件两端建立质控防线。硬件依靠MEgo设备多视角、多模态采集,降低视觉、触觉、姿态信息的偏差;软件依托MEgoEngine完成位姿重建与动作映射,搭配ManiEval多维度质检体系,从数据格式、任务完整性、传感器质量、语义准确性、动作可学习性等方面进行综合评估。通过践行“不过滤,只分级”的思路,让每一条真实采集数据都能够找到适配的应用场景。
中国信息通信研究院人工智能研究所具身智能与机器人部副主任张蔚敏认为,众包数据平台的价值,不只是汇集大量行为记录,更要依靠任务组织、数据工程、质量控制与闭环运营,把分散的数据转化为可训练、可评测的数据资产。
目前,觅蜂科技百万小时级无本体数据,已经供给腾讯RoboticsX实验室、蚂蚁灵波等客户投入使用。至于众包模式能否持续稳定地交付高质量数据,“机器人训练师”能否从发布会上的证书变成一份真正可持续的工作,仍需要更长时间观察。
本报综合报道 随着具身智能产业加速走出实验室,走向各类真实作业场景,真实物理动作数据供给不足,正成为人形机器人落地绕不开的瓶颈。继海外Figure公司推出Index平台,付费征集真实任务视频用于模型训练之后,近日,觅蜂科技在上海发布“觅蜂派”具身智能数据众包采集平台。
平台面向全社会招募“机器人训练师”,各行各业普通人可在日常工作、生活中完成动作采集并获取报酬,把实操经验变成机器人训练的核心“教材”。
机器人从实验室走进真实工作间
过去三年,具身智能行业逐步从研发阶段迈入部署落地阶段。不过机器人要从实验室走向仓储、零售、家庭等真实环境,首先就要跨过真实世界数据短缺这道坎。
在此之前,行业普遍采用真机遥操模式采集数据,操作人员借助手柄、VR设备操控机器人完成任务示范。这套方式产出的数据与机器人本体匹配度较高,但产能受制于机器人数量、操作人员和场地等因素,一旦扩大规模,硬件、人力、运营等成本随之水涨船高,很难满足产业快速增长的数据需求。
行业内部逐步形成一套数据分工思路,简单概括为三类模式互补:无本体采集拓展场景规模,真机遥操输出适配机器人本体的数据,真实场景部署持续完成模型修正迭代。所谓“无本体采集”,即不需要绑定特定机器人硬件,只记录人类真实操作行为,并通过轨迹重建、动作转换等方式适配不同模型,觅蜂派正是顺应这一产业需求推出。
觅蜂派整套系统由自研MEgo数采设备、觅蜂派App、数据治理引擎MEgoEn⁃gine三部分组成。用户通过App领取任务,佩戴采集设备在现实场景完成指定操作,平台依据审核后的有效时长结算报酬。原始采集数据汇入MEgoEngine后,会经过处理、标注、质量评估等环节,将人的操作拆解为抓、拿、放、拧、按等120多种原子动作,通过位姿重建、动作映射,转化为模型可用的训练数据。
截至8月31日,第20000套MEgo采集设备已经下线,累计产出超过100万小时真实世界无本体数据。据觅蜂科技披露,觅蜂派目前覆盖了22大类场景、5000多个任务以及50000多个真实环境,涵盖物流、仓储、餐饮、养老、医疗、农业、非遗等多个赛道。
众包模式挖掘千行百业数据增量
有别于传统专职采集团队,觅蜂派把数据采集的触角延伸到普通劳动者身边。网约车从业者可以利用做家务间隙记录浇花、整理桌面;非遗手艺人能够录制揉制、包馅等手艺动作,把传统技艺转化为机器人可以学习的素材。普通参与者无需掌握编程、机器人专业知识,就能成为一名“机器人训练师”。
平台正式发布前已经完成一个月内测,内测期间注册用户达2万人,累计收到1.3万份采集任务。据现场实测发现,觅蜂派App上的设备租金定价为39元/天,发布会推广期内折扣价为19元/天。觅蜂派业务副总裁张智富表示,收取设备使用费的目的不为盈利,仅是设置一道门槛——如果设备免费发放,用户可能不会认真使用。后续平台或将根据采集者的有效时长和数据质量给予动态补贴,逐步降低活跃采集者的设备成本。
为扩大参与者激励,觅蜂派同步推出总规模超亿元补贴计划,具体包含5000万元任务补贴、2000万元设备补贴、3000万元线下服务网络建设投入以及200万元保险保障,并搭建M1至M5五级采集者成长体系。推广周期内,符合条件用户还可以享受信用免押政策。目前,觅蜂派已上线各大应用商店,在全国40座城市开展运营。
觅蜂科技董事长兼CEO姚卯青同时是智元机器人联合创始人。在他看来,百万小时的数据规模已经跟不上市场节奏,不少模型企业的数据需求已经来到数百万小时级别。产业瓶颈不只是数据总量,更在于场景丰富度。像家庭叠衣服这类场景的数据已经趋于饱和,但修水管、修车、理发这类专业技能场景,如果依靠专职团队拓展效率很低,众包模式恰好可以解决“场景进得去”这一难题。
不过,众包模式下如何管理大量分散的C端采集者,仍是一个开放问题。张智富坦言,众包C端用户的管理本身难度很大,对比外卖行业经过近十年迭代才建立起可靠的配套体系,觅蜂派的全链路体系仍在持续完善中。
质量管控仍是核心考题
众包模式能够快速做大数据产能,但数据质量始终是绕不开的行业考题。
姚卯青介绍,用户提交采集任务后,平台会在一天内完成自动化初筛,剔除无效数据;通过初筛的数据,还要再经过轨迹提取、人工抽检等多道工序。经过结算环节的数据,最终可用率超过95%。平台不会把数据简单分为“好”与“坏”“0”或“1”,而是按质量分级,匹配不同模型训练阶段的需求。
这里也存在一个行业共性争议:部分第一视角采集,会要求人放慢动作、固定流程,方便算法解析。可一旦人的动作刻意“迁就算法”,现实环境里的快速动作、物体遮挡、现场纠错、非标准化操作就会丢失,模型学习到的行为样本会被人为收窄,看似好处理的数据,实际训练价值反而打折扣。
针对这一痛点,觅蜂派从软硬件两端建立质控防线。硬件依靠MEgo设备多视角、多模态采集,降低视觉、触觉、姿态信息的偏差;软件依托MEgoEngine完成位姿重建与动作映射,搭配ManiEval多维度质检体系,从数据格式、任务完整性、传感器质量、语义准确性、动作可学习性等方面进行综合评估。通过践行“不过滤,只分级”的思路,让每一条真实采集数据都能够找到适配的应用场景。
中国信息通信研究院人工智能研究所具身智能与机器人部副主任张蔚敏认为,众包数据平台的价值,不只是汇集大量行为记录,更要依靠任务组织、数据工程、质量控制与闭环运营,把分散的数据转化为可训练、可评测的数据资产。
目前,觅蜂科技百万小时级无本体数据,已经供给腾讯RoboticsX实验室、蚂蚁灵波等客户投入使用。至于众包模式能否持续稳定地交付高质量数据,“机器人训练师”能否从发布会上的证书变成一份真正可持续的工作,仍需要更长时间观察。