0

编辑丨李希
数据攒到百万小时,机器人就能在陌生场景中稳定干活吗?
对具身智能企业而言,数据规模一直被视为模型能力的重要基础,不少厂商都在冲刺“百万小时级”数据建设目标,试图通过更大规模的训练数据,推动模型能力进一步跃升。但当机器人真正走出实验室,行业也逐渐意识到:数据时长与实战能力之间,并不存在简单的兑换关系。
这是因为,真实世界不会照着训练样本重演。杯子换了材质,货架调整位置,抓取途中物体突然滑落,机器人都要根据现场变化重新判断、实时调整。数据时长可以不断累加,但模型能否应对训练集之外的变化,最终还得放到真实任务中检验。
随着具身智能加速从演示走向真实作业,数据竞争的评判标准也在变化。除了“积累了多少小时”,行业开始追问一个更接近结果的问题:新增的数据,究竟给模型带来了多少实打实的能力增益?
围绕这一问题,数据供给也开始向训练全链路延伸——从采集真实交互,到构建可供模型反复试错的虚拟环境,再到以真机反馈指导下一轮数据生产与训练,以Real2Sim2Real为代表的虚实融合闭环,正在打通这些环节。

01
具身智能需要规模化数据,这一点仍是行业的基本共识。
在不久前举办的第九届中国机器人峰会期间,星海图商务总监沈鑫表示,一个合格的产业级模型至少需要百万小时级的数据积累。浙江大学教授、浙江人形机器人创新中心首席科学家熊蓉则从研究角度指出,具身智能领域确实存在Scaling Law,随着训练数据增加,模型性能也会持续提升。
但问题在于,数据达到百万小时,并不意味着机器人一定能够应对真实世界。越来越多从业者开始提醒,数据增长与能力提升之间,并不存在一条可以直接换算的直线。
在2026年外滩大会期间,破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲谈到,百万小时比十万小时多一个数量级,容易比较,但目前并没有看到数据数字越高,模型效果就一定越好。他并非反对扩大规模,而是主张“边扩边找,边找边扩”,先判断什么样的数据有效,再继续放量。
在无问智科创始人刘盛翔看来,随着具身模型任务复杂度和应用场景持续提升,行业对数据基础设施的需求也在变化:从早期关注数据规模,进一步走向对场景丰富度、任务丰富度、动作丰富度、示教质量及最终模型增益的综合要求。再往前一步,数据基础设施还应提供支持物理AI强化学习(RL),以及未来自我递归学习(RSI)的虚拟环境和虚拟世界。
具身智能的数据竞争由此进入一个更难的阶段:既要扩大供给,又要让新增数据切实回应模型的能力需求。规模与质量,能否同时提升?

02
“高质量数据”听起来并不复杂,但落到模型训练中,判断标准远不只是画面是否清晰、动作是否规范。
蚂蚁灵波首席数据科学家黄用韬将数据质量区分为两个层面:视频不掉帧、画面不失真、多传感器时钟同步,属于必须满足的工程底线;越过这条底线,样本是否有价值,则与训练目标紧密相关。若希望模型学到稳定、平滑的动作,可能需要较为一致的轨迹;若希望提升泛化能力,就需要物体位置、形态等更丰富的变化。
Physical Intelligence的π 0研究提供了另一种观察角度。研究团队将机器人模型的训练分为预训练和后训练两个阶段:预训练数据需要覆盖广泛任务和多样行为,帮助模型形成通用能力;后训练数据则更强调示教策略的一致性与流畅性,使模型更好地完成特定任务。
研究同时指出,只使用高质量示范,模型可能因缺少失败样本而难以学习纠错与恢复;只依靠多样但质量相对较低的数据,又难以形成高效、稳健的执行策略。多样化经验与高质量示教,需要在不同训练阶段相互配合。
这也让数据质量有了更具体的判断尺度:一段数据是否准确、完整,决定它能否进入训练;它是否覆盖模型的能力缺口、能否改善任务表现,则决定它对当前训练有多大价值。
对数据生产者而言,这意味着仅仅把数据采集和处理好还不够,需要更深入地理解模型需求。哪些经验值得扩大供给,哪些样本可以减少,哪些场景仍然缺失,都需要结合模型训练与评测结果持续判断。数据生产也因此从一次性交付,逐步走向与模型迭代同步进行。
在刘盛翔看来,数据的规模与质量并非必然对立,兼顾两者的关键在于高质量的虚实融合闭环:真实世界数据能够提供物体交互和物理变化的依据,仿真与生成数据则可以扩展场景和任务分布;两者通过训练、评测和真机反馈相互校正,才能让数据生产持续围绕模型的能力缺口展开,实现“又多又好”的数据供给。
世界模型在这一过程中承担着连接真实世界与虚拟世界的关键角色。通过学习真实数据中的空间结构、物体关系、运动过程和交互规律,世界模型可以对现实场景进行理解、重建与生成,将有限的真实经验转化为更多可供模型训练和试错的虚拟环境。

世界理解模型构建的自动化数据生产管线
基于这一思路,无问智科构建了“世界模型×数据工厂×世界模拟器”技术体系,以真实数据为物理世界的锚点,以世界模型扩展可训练的场景与任务空间,再让模型在虚拟环境中训练,并通过真实机器人检验效果。模型暴露出的能力缺口,又可以指导下一轮数据采集、世界生成和仿真训练。
通过这套技术范式,无问智科推动“规模化数据生产”走向“高质量虚实融合闭环”,试图为模型训练“规模化、高质量、低成本”难以兼顾的“不可能三角”寻找破解路径。

03
无问智科构建的虚实融合闭环,可以概括为“采集世界、生成世界、模拟世界”,分别由“无垠”数据基座、“无臻”Ego2Sim训练环境生成平台和“无穹”世界模拟器承接。
第一步,是通过“无垠”数据基座采集和理解真实世界。
无问智科使用自研多模态设备,以“无感野采”方式采集真实任务中的人类行为、物体交互、环境及物理信息。与在固定数采场地中预设动作不同,这类采集更强调保留真实工作过程中的场景变化和操作经验。

大规模无感野采范式高效获取数据
采集只是起点。原始数据还需要经过清洗、对齐、筛选、重建、标注及跨本体处理,才能转化为可直接用于训练的Model-Ready数据。据公司披露,其通过世界理解模型建设自动化数据生产管线,使Raw Data到Model-Ready Data的处理效率提高了500%至1000%。
目前,无问智科已进入物流仓储、工业制造、家庭服务和商业零售等场景,累计沉淀数十万小时级真实物理交互数据,月度数据生产能力超过2万小时。真实采集为模型提供了理解物理世界的“锚点”,也为后续生成和模拟奠定基础。
第二步,是借助“无臻”生成平台,将有限的真实经验扩展为可训练的数字世界。
依托世界模型,“无臻”可以对真实场景进行理解、重建与生成,自动生产Sim-Ready 4D资产,以及用于强化学习的场景和环境。这里的目标并非简单复制一处现实空间,而是基于真实信息改变物体、布局、任务条件和交互过程,让模型接触更多现实中可能出现的情况。
由此,一处真实场景不再只产生一批固定示教。它可以被结构化和重构,衍生出大量新的物体配置、动作组合与任务条件,扩大训练数据的覆盖范围。公司披露,其Sim-Ready资产的构建时间已从3天一个缩短至5分钟一个,并已建设百万级Sim-Ready资产库。
第三步,是依托“无穹”世界模拟器,让模型在生成世界中训练、评测和验证。
“无穹”通过高精度可微分物理仿真,为物理AI提供可以大规模试错的训练环境。相比直接让机器人在现实中反复尝试,虚拟环境可以并行生成更多训练过程,也能避免部分真机损耗和安全风险。
不过,虚拟训练的价值最终取决于能否迁移到现实。传感器噪声、接触误差、物体形变等因素,都可能造成仿真与真实世界之间的差距。因此,无问智科的技术路径并未停留在Real2Sim,而是进一步将训练结果带回真实机器人测试,形成Real2Sim2Real闭环。


高精度世界生成物理仿真
这套闭环路径的实际价值,已经在客户合作项目中得到验证。据公司披露,在与一家头部客户的合作验证中,基于生成世界开展在线强化学习后,模型在相关任务中的仿真成功率由9.7%提升至79.8%;相关能力迁移至真实机器人后,任务成功率提升超过50%。

04
一套新的技术范式能否真正跑通,不仅取决于技术路径是否成立,也要接受商业市场的检验。订单与复购反映客户是否愿意为实际价值买单,资本投向则体现市场对其发展前景的判断。两类信号共同勾勒出具身智能产业的数据需求正在发生的变化。
据无问智科披露,其具身智能业务订单已达数亿元,订单同比增长超过3000%,预计收入同比增长超过1000%;头部客户覆盖度及客户复购率均超过80%。公司已与多家具身智能企业和基础模型公司围绕真实数据、仿真、评测及Real2Sim2Real闭环展开合作。
今年9月,无问智科宣布完成数亿元A轮融资,由洪泰基金领投,洪山资本、中电数融、狮城资本跟投,架桥资本、力合金融、力合中科、灵澄未来等老股东超额追投。募集资金将主要用于世界模型研发、真实物理交互数据规模化生产、Sim-Ready资产体系与世界模拟器建设,以及Real2Sim2Real全链路能力完善。
订单增长、客户复购与融资投向,共同指向一个日益清晰的趋势:随着机器人从实验室进入工厂、仓储和家庭,企业的数据需求正在从“获得一批训练数据”,延伸至补齐模型短板、扩展训练场景、降低试错成本,并通过持续反馈推动模型迭代。数据基础设施的价值,也开始从数据交付能力向训练闭环能力延伸。
未来,数据时长仍是衡量供给能力的重要指标。但在“多少小时”之外,行业会更看重一张更接近真实结果的成绩单:机器人掌握了哪些新任务,面对环境变化能否及时调整,在虚拟世界中学到的能力又有多少能够迁移到现实。具身智能的数据竞争,最终将落在数据能否转化为可迁移、可验证的真实能力上。只有走出数据集、经得住真实任务检验的能力,才能推动机器人真正进入产业现场。