全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
业界 正文
发私信给董子博
发送

0

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

本文作者: 董子博   2026-07-20 22:48 专题:WAIC:世界人工智能大会
导语:今天的物理 AI,不只比“武功”,更得拼“内力”。
WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」
今天的物理 AI,不只比“武功”,更得拼“内力”。

  作者齐铖湧 董子博

    编辑丨马晓宁

                                                                                                       

WAIC 2026 到了最后一天,逛了无数个具身展台,心里不禁有了不少感慨。

柔性抓取可以抓异形物体了,长程任务也更复杂了——技术飞快进步,好像通用具身离我们已经不远。但 Demo 越炫,人气越足,作为一个参加过 n 次的 WAIC“老人”,就越觉得这届 WAIC 似乎少了些什么——模型吹得天花乱坠,底层的数据基建却鲜少有人谈及。

数据,无疑是具身智能行业中“房间里的大象”——在 WAIC 上随便和一位从业者深谈两句,大家都会不约而同地陷入同一种焦虑:实在太缺数据了。

在AI科技评论看来,要构建具身智能的数据基础设施,必须同时回答两个极其硬核的问题:

第一,你能搞到多少数据?

第二,这些异构的、非结构化的数据,能不能被有效地共同学习?

带着这两个问题,在今年的 WAIC 现场,有一家公司展台吸引了 AI 科技评论的关注:跨维智能(以下简称“跨维”)。

用一句话来说:要实现通用的具身智能,跨维想做的,是“物理 AI 基建狂魔”。

要让具身智能通用泛化,首先要做到智能的涌现,去理解复杂多变的真实世界,和人类一样有一种“物理直觉”;其次要能够随机发挥,在不确定的环境中因地制宜、举一反三;最后更要可以自主纠错,减少人工介入,提升容错韧性。

而要达成这个目标,海量的、可对齐的数据,则成了物理 AI 基建中一块必不可少的拼图。

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

01


批量生产海量数据,

仿真才是超级大杀器

都知道数据量重要,但想要把数据量“堆”出来,却不是一件易事。

靠真实环境里一台台机器人去“死磕”采集,不仅成本高得令人绝望,且要覆盖全部长尾场景,又要耗费无数的时间。

真实世界太有限?机器人在虚拟世界的仿真系统里,一样能采到好用的数据。

在 WAIC 2026 上,跨维的自研仿真引擎 DexVerse,就是为了这个目标闪亮登场。

DexVerse 牛在哪里?剧透一下:它是当前全球唯一一款,支持同场景下多物理场耦合的具身智能仿真引擎。

在 DexVerse 里,刚体、柔体、布料、流体甚至切割动作可以同时发生、相互影响。比如机器人切面包,系统能实时计算出物体拓扑结构的改变与全新的切面;机器人叠衣服,引擎能精确模拟手、衣物和桌面之间持续的接触与形变,而不是粗暴的“视觉穿模”。

很多人知道,做仿真的头部大厂英伟达 NVIDIA 推出的 Isaac Sim 平台很强,但 DexVerse 也有与之一战的实力。Isaac Sim 平台只能同时耦合 2 种材质,DexVerse 则可以同时耦合刚体、软体、布料、流体 4 种材质,能力范围更广。

并且,DexVerse 不仅能实现 Isaac Sim 目前做不到的高保真软体动态切割,彻底告别死板的预设轨迹。在处理复杂的刚体与布料耦合时更是做到了真正的物理级无穿透,自然堆叠与受力形变的精准度显著领先于英伟达。

Isaac Sim 能力的确不弱,而今天的 DexVerse,或许有能力成为前者在仿真领域一个势均力敌的对手——或者一个好用的国产替代。

有了能把复杂物理世界实时“算”出来的 DexVerse,跨维的下一步,就是批量化地生产具身可用的高质量数据,把机器人的训练,从手工作坊变成数据的“生产线”——这正是“基建狂魔”打下的第一根地桩。

不像物理世界,虚拟世界里,无数的训练可以同时发生,并且迭代更快,成本更低。使用 DexVerse 的生成式仿真,不仅让真机数据采集的消耗大幅降低,更给了客户快速定义新任务、新物体、新场景的权力,并能即时在仿真系统中进行验证。

如果能直接支持机器人训练的数据,能够像图片和视频一样能够被自动化地批量生成,那么具身智能距离通用就又进了一大步。

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

02


“数据对齐”,

才是内行人真正关注的细节

有了海量数据,就能直接喂给大模型吗?

近期行业内的一系列研究(如阿里的 Qwen-RobotManip 新工作等)不约而同地指向一个残酷的事实:将异构的机器人数据简单混合,往往会引发负迁移——也就是“帮倒忙”。

不同机器人、不同相机视角、不同坐标系的数据,在模型眼里完全是鸡同鸭讲。因此,行业正在形成一个新共识:“Alignment before scale”(对齐是规模化的前提)。

今年六月,跨维智能率先提出 Dexterity-BEV 统一表征技术,系统性地将 BEV 方法论推进到具身智能数据基建层;同月,又拿下 WorldArena 世界模型榜单 Track 2 赛道全球第一。

同月前后,国内外顶尖团队也陆续发布了类似工作,如阿里Qwen-RobotManip、佐治亚理工的 Danfei Xu 老师的 EgoWAM、Rethinking VLA Scaling等。

而到了今年的 WAIC 上,跨维则更进一步,直接端出了百万级时空动作对齐数据集 Aligned DexWorld。

Dexterity-BEV的积淀,Aligned DexWorld 让全行业真正拥有了“开箱即用”、能够被有效共同学习的海量物理数据。数据集网站如下:https://dexforce.com/aligned-DexWorld/。

Aligned DexWorld 包含了超 200 万条高质量异构数据样本。这里面非常“五花八门”:有来自不同本体的真机数据(人形机器人与机械臂)、有仿真数据,还有第一人称的人手演示数据。区别于传统仅仅做“格式规整”的数据集,Aligned DexWorld 的核心价值在于“深度物理级对齐”,它让人类数据与机器人数据,真正“说上了同一种物理语言”。

具体来说,跨维对数据进行了三个对齐:

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

空间对齐: 统一多相机、多设备的三维坐标系,消除观测偏差,让模型专心学习真实场景的物理特征。

动作对齐: 摒弃绑定特定硬件的表征方式,转化为通用物理表征,实现跨机器人、跨设备的数据可迁移与联合训练。

对齐: 规整硬件频率、人工操作带来的时序差异。

面对这 200 万条庞大的异构数据,如果全靠人工死磕,成本无疑是天价。跨维展现出了作为“基建狂魔”的工程智慧:

在处理精度上,他们搭建了“人工校准+几何求解+模型辅助+人工核验”的标准化闭环。让每一条数据的对齐逻辑均可追溯、可复现,咬住大规模数据的整体稳定性。

在数据标注上,跑通了全自动标注流程。这套打法不仅大幅削减了人力成本,更高效地产出了标准化的高质量子任务数据,能够显著提升具身模型的泛化能力。

可以说,Aligned DexWorld 为整个机器人行业,实打实地搭建起了一个低成本、可复用的数据生产底座。

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

03


具身先有底层基建,才有物理直觉

有了强大的数据生产和对齐能力,跨维还需要实际地把数据和训练基础设施用起来,并且验证这一套体系的有效性——除了可以独立服务其他不同机器人企业、研究i机构和模型开发者,跨维智能的旗舰世界模型 DexWorldModel,就成了“数据生产-模型训练-真实场景落地”闭环的最后一块拼图。

人类能够和物理世界交互,需要的是一种“物理直觉”,能够做到长程地、抗干扰地、精确地操作——机器人要越来越接近人类,也必须具备这种“直觉”。

在 WAIC 现场,跨维展台被围得水泄不通的,是一个“机器人商超扫码分拣” Demo。作为展厅里唯一一个还原零售扫码场景的展台,机器人体现出的能力相当全面:不仅要从一筐随机堆放的商品中抓起硬度、外形不一的瓶子,更要扫到瓶身上的条形码,再把瓶子放到指定的位置。

面对非标的、甚至训练集里从未见过的饮料瓶,机器人展现出了极其类人的适应力:它自主涌现出了侧向掏取、扶正后抓取等策略;当抓取滑脱或扫码失败时,它无需人工复位,能够实时感知错误并自主调整策略重新执行。

而在扫码的场景,真正的挑战,甚至不在于 Pick & Place,也不在于扫码,而是“找到条形码”。

找到条形码,是一个复合型的任务——在真实场景中,条形码在瓶身上的位置和朝向都不是标准化的,它可能背对相机、被手遮挡……要找到条形码,机器人必须学习人类的方式,一边调整抓握瓶身的姿态,一边重新规划动作,一边观察寻找条形码,而非机械地执行预设的轨迹。

种“手、眼、脑”一体的能力,考验的不仅是具身大脑在面对非标问题时的操作、观察和决策能力,更有机器人在面对非标问题时,涌现式的自主“解题”能力。在 WAIC,跨维还展示了一个 Demo,模拟电子制造产线中的常见场景——手机装盒。面对这个需要精准识别、精密操作、抵抗环境干扰和操作失误的工作,不少厂商的 Demo 选择的是遥操的方案,但跨维的 Demo 则是通过世界模型 DexWorldModel 实现,可以直接异地部署。

通过仿真合成数据和真机数据结合训练,DexWorldModel 驱动的具身机器人,不仅能够实时自动识别物料的位置和姿态,还能自主识别漏抓、物料偏移等异常情况,不再只执行预设动作,可以重新规划路径,完成任务。

这种“智能涌现、随机发挥与错误恢复”的能力,正是跨维“基模预训练 + 场景 Finetuning + 世界模型”的实战检验。世界模型在其中扮演了关键角色:在动作发生前,它能在脑海中进行“物理预演”,评估抓取成功率;它能跨视角补全 3D 场景,预测下一个状态。

机器人不再是死记硬背坐标系,而是真正理解了“瓶子”这个物理概念,从而在充满混乱与不确定的真实世界中游刃有余。

同样的毫米级精密操作与抗干扰能力,也在跨维展示的“手机装盒产线 Demo”中得到了印证,充分展现了其面向复杂工业场景的柔性适应力。

这就是为什么要做底层基建的重要原因,当具身机器人拥有了物理直觉,它的上限会被无限提高。

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

04


结语:具身智能发展的第一性,

到底是什么?

逛完跨维的展台,AI 科技评论最大的感受是:跨维和跟现在的很多具身智能公司,玩的是两套逻辑。

不少公司要么赶着造机器人本体,要么卷大模型,或者拿一堆真机数据死磕某个单一场景的抓取——把一个垂直单点钻深钻透,是他们心中实现物理 AI 落地最直接的路径。

在一众竞逐者中,跨维却显得像个“异类”:他们想要的构建的,是一个体系,涵盖从物理引擎、生成式仿真、世界模型和工业部署的全流程板块,来寻找通往通用具身智能的可能。

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

让机器人能把一个动作、一个场景做到极致,当然有它的价值;但在维看来,第一性的问题,永远是用更低的成本,让机器人完成学习-试错-规模落地的闭环。

技术最终要回归商业本质。跨维同时也实实在在地把优秀的技术向产业输送。截至目前,跨维的技术已在智能制造、文旅服务等领域落地 50+ 真实场景,部署了超 1500+ 具身模型,并实现了非常可观的商业转化。

当其他人望着具身智能灿烂的星空,把头仰得高高的;跨维智能却在“基建狂魔”之路上走得越来越远,把手深深地埋进沃土——他们知道,只有地基足够牢靠,其上的高楼才能在有朝一日,让头顶明亮的星星触手可及。雷峰网(公众号:雷峰网)

WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」
WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」
WAIC 观察:通用具身智能要在有生之年实现,急需「物理 AI 基建狂魔」

雷峰网原创文章,未经授权禁止转载。详情见转载须知

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说