全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
业界 正文
发私信给李雨晨
发送

0

日冕开物肖中阳:把蔚来世界模型量产后,我兑现102周前的创业决定|物理AI 50人

本文作者: 李雨晨   2026-09-27 21:06
导语:“我手机上有一个日历,每周一都会提醒我一个重要的日子。今天是102周——102周之前,我设了一个节点,叫‘启航计划’。”

日冕开物肖中阳:把蔚来世界模型量产后,我兑现102周前的创业决定|物理AI 50人

肖中阳的履历,是一条典型的“车辆工程到智驾再到具身”的路线。

本科北理工车辆工程,博士清华车辆与运载学院(导师杨殿阁教授,智驾方向开门大弟子),博士课题就是高级别自动驾驶。2020年毕业先去了高德做众包建图,一年后加入蔚来,成为NWM(NIO World Model)世界模型创始团队成员。

在蔚来四年多,他从时空信息部的众包建图做起,后来成为低速场景(停车场、园区、换电站)世界模型的交付负责人,交付上向任少卿汇报。

2025年5月29日,他主导的无图自主探路版本向全量用户推送,三天覆盖60万辆NT2平台车型——这是行业首个在复杂交互场景量产的世界模型,比特斯拉早了6个月。

交付完成后,他选择离开。2026年1月中旬,肖与清华师弟钟元鑫(前华为天才少年,现负责基座模型)、博士亲师弟王云龙(前智元机器人,现负责后训练与交付)、博士同班同学戴亚奇(现负责市场)联合创立日冕开物理。成立3个月完成两轮融资,团队已达90多人。

9月,雷峰网(公众号:雷峰网)左林右狸频道在日冕开物的北京办公室见到了肖中阳,进行了一次近两小时的深度对话。对话回答了三个问题:1、第一个量产的世界模型是怎么做出来的?2、世界模型从从智驾迁移到具身,有何同与不同,难点和要点是什么?3、在具身世界模型的赛道里,日冕凭什么可以持续留在牌桌上。再介绍一下,《物理AI 50人》是雷峰网左林右狸频道推出的高管访谈栏目:不追热点、不凑数量,我们只对话物理 AI 赛道最有权重的核心决策者。从智驾到具身,从芯片到世界模型,记录不对外说的判断、抉择与野心。感兴趣的具身创业者和读者,可添加专题作者微信 Gru1993 交流。

01 从交付第一个世界模型到决定创业

左林右狸:你是从北理工车辆工程毕业之后,去读了清华的博士,为什么最后去的是智驾行业?

肖中阳:我本科一开始学的是信息工程,转到了车辆工程。我到清华读博的时候,还是叫汽车系。后来我的导师杨殿阁教授创立了车辆与运载学院,继而成立了车辆与运载学院的汽车工程专业。2020年我博士毕业,博士课题方向就是高级别自动驾驶,研究自动驾驶软件和模型。我在本科还做过机器人的创新创业项目,带队拿了全国挑战杯一等奖——全尺寸的人形外骨骼机器人。那时候真的没人做。我对画机械图、结构设计,电驱、电控非常感兴趣。后来读博时还是觉得机器人缺大脑,我理解的大脑是对场景的动态理解,当时做“大脑”最好的方向是自动驾驶,这是一个卡、数据、模型最集中的行业,所以我就进入了智驾。

左林右狸:2021你加入了蔚来?这是你智能驾驶职业生涯的起点吗?

肖中阳:对,2021年蔚来已经决定自研,之前一代车用的是Mobileye的方案。我算是蔚来世界模型的创始团队成员。加入蔚来之前,我在高德待了一年多做众包建图。当时小鹏用过我们的高精地图,小鹏的的定位引擎、数据渲染也是高德提供的,最先是落在小鹏P7上。

但我觉得,高德的合作模式是to B,或者说是造铲子的人,没有非常明确的闭环。而蔚来有自己的车型,能建立完整的闭环。蔚来非常重视用户体验,用户夸或者骂一个功能,我们都能直接听到。还有斌哥组织的全国各地用户面对面,几十个用户坐在你对面,大家是在面对真问题,解决真需求。

加入蔚来后,我是在时空信息部,做众包建图,还是上一代的技术方案,包括高精定位、轻图这些。在2023年之前,我们已经做过一些世界模型的前期探索。那时候不叫世界模型,就是用户数据共享,从中挖掘道路元素和关键地理信息,引擎里采用这些先验数据。比如停车场底下有几层,每个路口的转向限制是什么。

但我们最终想做的是,在没有任何经验的情况下,让车子第一次来到停车场后可以自主理解场景,并且能采取正确行动,还能听懂人的任意指令——比如你跟车说“再下两层,看到一个红衣服的人右转,然后看到一个什么样的人停下来”,这种长时序指令也能执行。所以,这个思路更偏向一个机器人的交互产品定义。

左林右狸:2023年已经有了世界模型的萌芽,正式提出NWM这个概念是什么时候?

肖中阳:NWM这个词是2024年7月份正式对外发布——NIO World Model,2023年全面切入到世界模型这个方向上。2023年之后,我们都是在World Model这个体系下面做的模型交互,所有功能都贴合NWM的大标签,但其实底下有好几个功能。

2024年行业开始讲VLA的时候,蔚来没有跟。我们对世界模型的定义很本质——不是具备什么结构就叫世界模型,我们定义的是它具备对未来世界的推演、认知和预测能力。证明了它能推演,说明它学到了一些规律;也因为它能推演,所以它做出的动作都是想好的动作,而不是条件反射式的动作。

一个非常直观的例子:我在一个路口,推演说我可以有10种选择,每一种对应什么样的结果?有些可能撞了,有些把你送到目的地,有些不够平顺。在这个定义下,2023年我们命中的就是当前这一套主流范式。这个过程就是reasoning,结果是更合理、更可控的。只要是这样的范式,我们都统称为世界模型。

这是当时蔚来智驾体系的vision(愿景)。只是说当前大家又在主流范式上衍生出一些新的内涵,就像当年的一些热词,大家多少会塞一些私货进去。比如说只要能刻画世界规律的,是不是都想叫世界模型?我们能看到有这样的现象。但我觉得我们当时的本质跟现在是呼应得上的。

左林右狸:2023年之后,行业和用户更关心的是城区和高速场景的NOA。而你一直在停车场这些低速场景方向,但最终你成为了世界模型的交付负责人,你觉得是什么原因将你推到了第一线?

肖中阳:低速这个方向,不像城区和高速条线那么多。一辆车想从停车场开出来需要先验信息,这部分工作由我来负责。开出来之后,需要理解认知能力,谁来做?还是我来做。我们感受到的还是,在同一个场景下,技术范式在不断迭代。我们一直是预研一代、上车一代,同时做两代。

预研的那一代非常幸运,是世界模型先上的,因为低速场景最能体现世界模型的能力——它复杂,需要理解人的指令,需要预测人的动作,需要预测跟其他车的交互,而且场景没有明确的交通规则,更多是非结构化的场景,所以天然更适合更大的世界模型去解决。

这也是我为什么最终能顶到第一线,成为世界模型的交付负责人的原因。(注:2024年,是蔚来智驾变化最为剧烈的一年。2024年6月,感知与规控团队合并为大模型部,撤销原感知、规控、环境信息、方案交付四部,新增大模型部、部署架构与方案部、时空信息部,标志着蔚来从传统 "感知 - 规划 - 控制" 串行架构全面转向端到端。半年后再次调整,任少卿亲自直管大模型部并新设技术委员会,时空信息部负责人袁弘渊离职,交付团队负责人一并换防 —— 组织为冲刺世界模型量产让路)

左林右狸:蔚来的世界模型从启动到量产,有哪些关键的节点?

肖中阳:2023年更多是资源团队自己的预研,先做一些技术上的储备和验证。但真正决策开始搞、立项、非常明确地签订交付责任,是2024年年底。然后我们做了一些取舍——你想打磨一个完美的版本是打磨不完的,肯定有一些长尾问题要解。我们当时做了一个决策,有两个选择:在全行业都没推出之前,把一个不完美的方案打出去;和等到完美之后推出,但不做首发。从市场竞争力的角度,我们选择了一定要做首发。所以锚定了一个时间点,2025年6月份。但其实我们比那个还早了一些,5月初就测试通过,等着发版。我们这个场景的封版是2025年5月29号,我记得很清楚。

左林右狸:为什么记得这么清楚?

肖中阳:因为那是我觉得真正量产的一个无图探索版本,挺有划时代意义的。之前真的没有人做出来,这样一个大参数量的模型,像人一样理解场景,这是之前大家甚至都不敢想的事情。而且这个版本比特斯拉早了6个月,这也是我非常满意的代表作。当时,NWM世界模型最先推送的是NT2.0的车型,因为NT2.0的车型的基数最大,我们一次性全量,分三天推送给了60万辆车。这个也可以称之为职业生涯的分水岭。我会将其划分两个阶段:一个是tech leader,一个是交付leader。交付leader有点像华为IPD体系下的PDT leader——向更高层要资源、阐明收益,获得投资,自我形成闭环,把商业成功的结果拿到。在这之前,我只管把技术做深、把性能做好。从做的具体事情上,也恰好分了两个阶段:一个有图,一个完全无图。无图就是真正拥抱模型,交给一个大模型去解决问题。

左林右狸:在蔚来沉淀的经验,有哪些是能复用到现在的创业团队?

肖中阳:我觉得最大的take away是三个:第一个是闭环。你需要把用户需要的东西完整、快速地做出来,让他提意见。这个很重要,这也是斌哥做用户面对面的原因。我们很重视终端反馈,防止你在做所谓标准化产品的时候闭门造车,做了不符合用户需求的东西。快速形成闭环、形成反馈机制、全流程看问题,这是第一个。第二个是,你看十年智驾五次技术革命,但最终把端到端做出来的,是当年做定位建图做得最快的那家公司——特斯拉。

特斯拉的地图团队非常厉害。不存在说突然冒出一个天才,提了一种想法就把一个工程问题解决了,让特斯拉冲到第一梯队。我们相信这个规律在具身行业也是一样的。现在大家的想法,说句实话大部分都来自于跟GPT的对话。在这个前提下,大家比拼的还是infra的效率、问题闭环的效率、训练模型的效率、数据的吞吐量、回归测试的指标是否合理、是否接近用户需求。

我觉得这个基础是一家公司发现终极范式的基础,是它的效率来源。当然还是会有一些聪明的科学家去想范式怎么迭代、表征怎么做。但我们认为,智驾最后几年的英雄主义是越来越少的。第三个是组织架构要服从算法结构。组织架构的调整一定要坚决果断、一定要高效。不是大家不努力,而是管理层没有把一些边界梳理得很清楚,就会引起很多混乱。只要把话说清楚了,就不是问题。怕的是大家都没对清楚,没有坚决划清边界。

左林右狸:现在很多智驾人转具身智能,是具备“理论上”的可行性的。有一些团队因为具备智驾量产的经验,就低估了具身的难度。之前我们遇到过一些团队训练模型花了大价钱,但是没有训好,你怎么看?

肖中阳:我明白你的意思。这也是我们团队在跟投资人接触下来,被评价为比较稀缺的一个点——我们虽然都是智驾出身,但是做完了世界模型这代范式出来的。可能有些创业团队在智驾的经历只覆盖了两段式的模型。两段式端到端在面对和解决问题的方法论,和世界模型是不一样的,包括有没有兜底、是不是需要做很多rule-based的东西。

我们是在智驾里面被完整训练过的这么一个团队,其实更符合大模型那套scaling的思路。总结下来:

第一,如非必要勿增实体,一定不要先做后处理;

第二,相信数据驱动,你的bet(可能成功的事情)一定是更大的模型、更多的数据、更典型的case,而不是想办法规定数采源的采集方式来避开问题,而是要保持case的多样性;

第三,对infra的重视程度很高。这一点我们跟很多DeepSeek、Kimi出来的人聊,也能达到默契——我们其实更偏大模型解决问题的范式。而且我们也不是纯智驾背景,云龙之前在智元也是做大模型交付。我们现在做数据infra的成员,很多都是来自多模态大模型公司的。大家经常给我贴车圈的标签,主要是我在蔚来待的时间太长了,但其实核心技术团队的几个大leader,还是有很多来自大模型公司。

02 从车端世界模型到具身大脑:最难的是表征

左林右狸:蔚小理在这两年都陆续成立了具身部门。你想要做具身智能,为什么没有选择在蔚来内部孵化?

肖中阳:我觉得面对一个新的事情,回到了智驾和具身不一样的地方。两者的商业模式、技术路线、包括模型的形态都不一样。既然要做这件事情,肯定是想做得更彻底、更长久,所以衡量下来,还是成立一家公司,从头去做这件事情,更Physical AI native,也就是更“原生”一点。

左林右狸:你是什么时候决定出来创业的?

肖中阳:我手机上有一个日历,每周一都会提醒我一个重要的日子。今天是102周——102周之前,我设了一个节点,叫“启航计划”。什么意思呢?就是我要创业,但当时我想的是以一种创业者的心态在大厂里面内部创业。

什么叫创业者的心态?

我当时读了王阳明的一篇文章,他讲知行合一——就是我要非常纯粹地先想这件事的成功需要哪些因素,然后把这个事情的成功跟自己绑定在一起,去想你需要做什么,而不是说带有偏见地说我喜欢什么、我倾向于什么、我不喜欢什么。当时想清楚这个之后,触发我去这样想的,可能跟当时的一些组织架构调整也有关系。

但我觉得想清楚之后,我的工作变得很快乐,因为你看到的是事儿逐渐变得越来越清晰。102周之前的2024年9月,我决定了以这种姿态去工作,创业就是一个更自然的事了——把场合从内部,比如少卿是我的投资人、蔚来用户是我的客户,变成我要在市场上找投资人、在千行百业找客户,但我做的还是那件事。蔚来世界模型2.0封版后,我正式离开。

左林右狸:车端世界模型向具身模型的迁移过程中,最难的是什么?

肖中阳:我觉得还是在于场景的需求,或者叫业务模型。智驾虽然穿行于物理世界,但它本质上没有跟物理世界产生真正的接触,它不需要去体会摩擦、形变这些。但真正进入物理世界去改变、操作这个世界的时候,你就要去处理这些问题。

这是为什么我们最早就在基模提出表征的原因——这些跟操作物理世界相关的信号,能不能被有效地提取出所必要的表征,送到基模里面去做因果推理。我们认为最核心的挑战,或者说业务的本质区别,也就是在表征。智驾找到了它好的表征,叫BEV feature,之后UniAD、两段式端到端、一段式端到端开始爆发。

我们认为现在具身的基模最缺的也是表征。现在没有人回答这样一个问题:我们有没有一个像BEV feature这样的map,能够把视觉、触觉、包括关节自由度这些数据,都编码到一个本质空间?这是我们看到最大的挑战。有了BEV这样革命性的东西,你就会发现后面就是堆数据、堆场景、解决部署问题。我们也是最早在做这件事,当然还没有把工作做完,但最近也陆续发了一些关于表征的论文,比如如何跨末端去表征触觉、动作、环境、经验,这是我们基模很重要的一部分。

左林右狸:所以。你们自研的 LaMPA 是“行业首个具身原生的隐式掩码预测架构”,也是为了解决表征问题?

肖中阳:是的,VLA 本质上还是语言模型那一套——先有语言,再把视觉和动作对齐上去。但语言对物理世界来说带宽太低了,你没法用语言说清楚“用多大的力、从什么角度去接触一个东西”。我们的判断是:只要是靠“对齐”搭起来的基模,就一定不是为物理世界原生的。生成式世界模型比 VLA 进了一步,但我们觉得还是不够。视频是二维的,机器人面对的世界是超高维的;看着像的两个东西,物理上可能完全是两回事;而且像素级的生成,大量算力都花在颜色、纹理这些跟操作无关的变量上了。所以我们的判断就是:跟语言对齐、视频对齐,都不是高效的。既然要做物理原生的基模,就应该面向物理世界from scrach地设计——这就是我们提出的 E³,环境(Environment)、具身自我(Ego)、经验(Experience)。LaMPA 就在这套统一表征的隐空间里做掩码预测,而不是去生成像素。这样一来,模型的上限是由物理世界本身决定的,而不是被语言或视频的表达方式框住的。

左林右狸:你们现在主要在哪些场景落地?

肖中阳:我们现在找的是一些高价值的、跟AI基础设施相关的制造场景。比如说远图是我们的战略客户,他有AI服务器的组装、测试、生产制造场景。

日冕开物肖中阳:把蔚来世界模型量产后,我兑现102周前的创业决定|物理AI 50人

这些场景的流水线上需要一些比较精细的操作,比如把一个板子放到测试台上,是亚毫米级的精度;包括装风扇、装散热器、插一些组件。这些场景一方面精度要求高,第二是泛化性——因为这个行业高速增长,迭代非常快。他们现场也有一些工业自动化设备,但经常放在那不用,因为新来一批料都来不及做适配,或者需要设备提供方的工程师飞过来,支付很高的费用重新调试。

这其实也是当下的一个关键问题:物理世界被“预训练完”的周期和难度极高。工厂是开放的、长尾的、天天在变的,新的状态永远会冒出来。一个机器人的能力如果完全取决于出厂前学了什么,部署出去之后一定会撞上天花板。

所以我们给的方案是:新的料来之后,“超级工站”只需要少量示教就能上岗,但上岗不是终点,上岗之后它能越干越好。它在产线上的每一次操作、每一次意外、每一次“没做成”,都会变成数据回流进来。模型把经验沉淀下来,下次碰到类似的料、类似的情况,就处理得更好。我们是一个“硅基工人”的逻辑,工人是越用越熟练的,机器工人也应该是这样。

左林右狸:大概多长时间能调试好?

肖中阳:我们现在是三个半小时。当然有一些简单的工序,已经能做到半个小时以内了,比如我们在对外展示的一些会展上的简单重复性操作,基本上半小时之内就能交付。这个随着基模的scaling也在不断压缩时间。工厂方普遍能接受的是一天,一天交货就可以。

日冕开物肖中阳:把蔚来世界模型量产后,我兑现102周前的创业决定|物理AI 50人

左林右狸:工厂对“良品率”有要求吗?

肖中阳:有的,但客户一般不会直接说超过多少良品率我就会买,他说的是“你造成的停产损失由你来承担”,一般会这样聊。但这个会演化成两个指标:

第一个是出问题的比率要做得非常低,这也是我们为什么要持续进化,它能越做越好,一定要有这样的能力;

第二个是从系统设计上要有兜底策略——这个料可以拿不上去,但我们要知道不能把它摔碎,或者知道出问题了能够求助、亮个红灯请求接管,这个是可以接受的。哪怕重启一次,可能也就浪费一分钟,其实不算在工厂的损失里面。所以它倒不是一个孤零零的指标。工厂的挑战在这,好处也在这——成败好坏是有明确评价的,这个非常适合早期我们做reward model。有明确评价之后,我们就能训一个打分的模型,分数低的时候机器人可以请求接管。而且这个好坏能在部署之后持续训模型,让模型变得更强。

因此工厂里那些“没做好”的时刻,反而是最值钱的数据。这点跟大模型差别很大:大模型的语料在模型诞生之前就有了,但机器人最有价值的数据,只能在他跟真实世界交互、犯了错之后才产生。这种数据比普通示教值钱得多,因为它直接告诉模型:你对物理世界的理解,在这个点是错的。系统就针对这个缺口去更新、去练,验证通过了再固化进模型。失败在我们这儿不是产品问题,是训练信号。工厂天然是一个可持续迭代、可不断进化的训练场。

左林右狸:柔性物体操作是不是更难?比如软包裹、衣服、线束?

肖中阳:是的,抓一个柔性的东西,要比刚性物体难很多,因为要处理的是复杂的形变,它的自由度和不确定性非常高。我们在工业场景也经常遇到,比如一个料不是白料让你抓,它一般会带一些包装,你要先撕开包装——有的是牛皮纸的,有的是塑料薄膜的,有的是气泡的,如何去摘除,这个就很考验模型。

如果有个benchmark的话,对柔性物体的操作肯定是最考验模型真正对物理世界理解的。比如给你一个U盘让你插上去,这是一个难度;但这个U盘后面拖了一根很长的线,你还要把线沿着捋过去、扥紧了再去插,后者才是真实的场景需求,而且确实很难。

想要提升柔性物体的抓取成功率,我们的做法是分三步走。第一步是仿真。仿真可以快速生成各种各样的场景,让模型先把基本的物理规律学会,打个底子。但仿真和真实世界总归有差距,所以第二步是拿真实数据做模仿学习。这里的泛化,我们拆成两个维度看:一个是场景的泛化,一个是被抓取物体材质的泛化。比如模型抓过玻璃杯之后,遇到一个上半截是玻璃、下半截是软胶的新东西,也能直接抓起来——这才是真泛化。走到这一步,模型对力和触觉就有了基本的理解。第三步,也是我们最看重的,是真机真实部署中的学习。真实交付要的是 99% 以上的成功率,这个差距只能在真实场景里磨出来。通过我们的 Physical RSI递归加速进化,机器人在干活时的每一次失败都会变成训练信号。到这一步,模型才算真正把力和触觉的规律学透了。我们甚至认为它可能超过人:人对力的感觉是凭经验的,而模型可以把每一次接触都量化记下来,而且一台学会了,整个集群都学会了。

左林右狸:工业场景对成功率的要求有多高?

肖中阳:三个9以上(99.9%),工业场景一般敲门的话你得告诉人家你是三个9以上。然后再告诉他大的问题我能给你兜底——我起码可以说即使有一次不成功,也不会以把料摔地上为前提。他们在意的是恶性结果出现的频率,尤其是一些测试工序,本身测试时间也很长,多等个一两分钟也能接受。

03 拿投资、建组织,日冕如何留在牌桌上?

左林右狸:日冕现在团队规模怎么样?

肖中阳:我们现在有90多个人,发展速度挺快的。北京上海两边都在招人,也换了好几个办公室。从团队角度,我们有一个交付部,横向拉通产品,包括产品、线上的解决方案、需求对接。另外就是技术中台,所有的infra、预训练、后训练都在这里,包括一些关键的硬件技术和系统。

再就是商务这些职能部门,包括市场、品牌。团队来源的话,智驾来的多一些,也有大模型的,也有传统机器人、自动化的。自动化的人其实很懂我们现在一些场景的真实需求,包括怎么跟客户对话、怎么触发他们的决策。智驾的人很懂工程和闭环,产品的闭环、问题的流转。大模型的人更懂怎么用data reuse的方式让它更快scaling,包括infra层面怎么训一个足够大的模型,让它足够稳定、快速地拿到实验结果。

左林右狸:钟元鑫是你的联创,你跟他是怎么走到一起的?

肖中阳:我当时在清华是智能交通(后来叫自动驾驶)课的助教,元鑫在清华读本科,我们就认识了。他本科毕设是在我们组做的,我带他做毕设课题。然后他去了美国,回到华为之后做智驾,我们交流比较多。后来我就找元鑫,说出了创业的想法。我知道他也一直有创业的想法,但我还是建议他先在大厂里面看看一个大的system是怎么运作的。他跟我说差不多看明白了。他在华为待了3年,2023年夏天到2026年。正好他也是在做世界模型,而且华为验证了VLA的一些局限性之后,直接去做了世界模型。所以我们的搭配很合适。

左林右狸:其他几位联创呢?

肖中阳:王云龙是我博士亲师弟,所以很熟,一些想法对齐也很多。其实是他先找的我。他说突然有一天做了个梦,梦见他书包的带子长出了手,能把桌面上的东西拿起来塞进去,然后把自己系住——其实就是pick and place加packing的demo。我说那是不得创业了呀?戴博(戴亚奇)是我博士同班同学,他是做投资的。更有意思的是,我是找他融资的。我向他请教融资需要具备哪些条件,如何路演。当时我们是在一个咖啡厅里,结果他说“我把自己投进来了”。我们几个都是车辆学院的,认识十几年了。很早就知道对方想创业,只是不知道啥时候会创业。能凑到一块,也是天时地利人和,大家都觉得在工业界有一些实践了,财务状况也能支持,一切都比较合适。人员到齐是在3月,正式开门营业。

日冕开物肖中阳:把蔚来世界模型量产后,我兑现102周前的创业决定|物理AI 50人

(从左向右:联创兼基模负责人钟元鑫;创始人CEO肖中阳;联创兼市场负责人戴亚奇;联创兼后训练与交付负责人王云龙)

左林右狸:你们成立三个月连续完成两轮数亿元种子轮融资,鼎峰科创、百度风投、远图未来都进来了。投资人有没有问过让你印象深刻的问题?

肖中阳:有一个投资人问过我关于组织的问题。他先问:物理AI的scaling是更像智驾,还是更像大模型?这个问题回答完之后,我觉得他的下一个问题很好:那你觉得日冕的组织应该像Kimi还是像蔚来?当时整个圈子对Kimi、Anthropic的一些组织架构设置评价很高,觉得组织就应该长这样才能去scaling。

但我说这个事情要根据业务去想。纯语言类的模型,它是能在一个像lab一样的组织里面运作的,因为所需的数据都在数据中心,而且公司只有一款产品,就是推一个模型出去,要满足各行各业的需求,所以benchmark和评测方式非常清晰。

这个时候每个人的想法都可以变成一个merge request,提一个测试任务,只要证明对结果有改进就可以了,所以他们非常扁平,不需要有信息差。但具身不一样,具身是物理世界的AI。物理世界AI的数据本身就需要进入到物理世界,所以它有硬件的部分、有交付的部分、有产品的部分。产品就是闭环的一部分,组织要支撑的是一个软硬一体的闭环,在这个里面就不能盲目追求所有人都没有信息差,不然迭代目标就乱了,阶段性目标也没法拆解。

所以我们应该是最大程度保持大家信息同步的同时,还是要有适用于这种软硬一体复杂交付的一套流程和组织。聊完这个之后,投资人会觉得,我们把组织问题想的比较清楚。

左林右狸:你们对于融资的节奏是如何把控的?另外,你们更愿意接触哪些背景、特质的VC,你们有没有拒绝(接受)过一些投资方,是因为对方提出了什么样的要求?

肖中阳:成立半年来我们已经陆续做了三轮,并且我们还会在接下来保持这个节奏,也非常感谢各位老股东对我们的大力支持。从投资人的角度,我们主要是偏好具备两类属性的投资人:其一是基于技术、产业的认知,对于物理AI的前景有超越周期认知和信任的投资人。我们在做的是一个持续改变底层生产力的行业,并且物理AI的特性就导致了会有很多的“脏活累活”,因此需要具备一定vision和定力才能持续保持信心,和我们携手一起穿越周期。其二是从场景、资源、战略、人才各个维度能给我们帮助和reward的投资人。说实话现在行业里更多听到的还是“掌声”,但我们是很警惕“杀君马者道旁儿”的;我们很多的老股东就是我们的WRM,都会从不同视角出发给我们提建议,并且帮我们一起想办法,这也是日冕能够保持现在这个加速度的重要原因之一。因此在投资人角度,我们期待接下来合作更多的“自己人”,帮助日冕持续“自进化”。

左林右狸:现在的组织设置,跟当初跟投资人聊的想法一致吗?

肖中阳:算是比较一致的。我们现在的技术中台,其实就维护一个像Kimi那样的产品,我们叫标准化的系统产品。交付部门是拿着标准的产品——本体加模型加训练工具、采集工具——去满足A、B、C、D四个客户不同的需求。但他们一定有定制化的需求,会变成一个交付团队做很多定制化的事情。然后他们的定制化信息要同步给系统产品部门,告诉他们这四家有一个共性的需求,需要承接到标准化产品里。

左林右狸:这个很像Momenta,曹旭东会要求团队做主线任务——每做一个交付的时候,提炼一个主线。

肖中阳:这样最终是个算账的逻辑,交付成本才低。技术中台这边更像Kimi、月之暗面,因为大家有很明确的交付目标和benchmark;交付这边就很像智驾,或者说to B的这种交付,偏落地、直接接触用户的。而且我们对整个行业的判断是,交付这一部分将来也能够被一些标准化的组织承接,比如FAE、FDE这样的组织,只是现在还没有形成这样的生态。所以我们非常重视的最终还是标准化的scaling能力、成本。

左林右狸:你怎么看大脑和身体的价值分配,两者的演化路径会是什么样?

肖中阳:我在2015年选智驾的时候,就是这样的判断:机器人缺的是大脑。真正让这件事变成生产力的,也是背后的大脑——它负责感知、认知、预测、决策、执行,出了问题还能恢复。我觉得这个是价值链最重要的一环,而且它的价值会越来越高。你看它scaling的路径,是先搞定一个场景,再搞定第二个场景,以大模型的范式去做的话,你会发现第三、第四个的斜率会越来越陡峭。而本体一定会变成一个斜率不那么高的东西。当然我们现在还没有把本体放到降本的逻辑上去看,整个生态行业一定会把成本做得比较低的。我们会从问题闭环的效率去看,哪些硬件的事情需要我们来做——你不可能说我提一个需求给供应商,他三个月后告诉我修了,我的产品就不迭代了,这个不行。

左林右狸:对于同样从智驾转具身的同行,你最想说什么?

肖中阳:我觉得还是要尊重物理世界的规律。智驾没有真正接触物理世界,但具身是要真正去操作、去改变物理世界的,这里面的摩擦、形变、接触,每一个都是新的问题。不要低估表征的难度,也不要低估闭环的价值。还有就是,具身的GPT时刻没有办法在实验室里做出来。你如果上来就闭门造一个啥都会干的机器人,不进入真实场景、不跟真实客户交互,是不现实的。你得先进入到真实的物理世界,拿到真正的反馈,在这个过程中让基模的能力不断scaling,把定制化的部分越来越少,直到某一天zero shot就能解决大部分问题——那个时候才是GPT时刻。

写在最后:

关于“日冕开物”这个名字,有一个小故事。这个名字最先是联创戴亚奇提出来的。当时大家先想出了slogan——"驱动每一次物理交互"。然后就在想,驱动每一次物理交互的是什么样的东西?后来想到日冕:日冕是太阳最热的一层,但用肉眼看不到,它没有形状也没有颜色。

一个驱动万物交互的东西从表面是看不到的,它不是某一个硬件,也称不上是服务或功能,就是一个很重要的能力,无处不在,但我们可能不能直观地看到它。这就是日冕开物名字的由来。

在蔚来的最后几年,肖中阳有一个很深的体感:智驾行业的英雄主义越来越少了。不存在一个天才提了一种想法就能解决工程问题。最终把端到端做出来的,是当年做定位建图做得最快的那家公司——特斯拉。比拼的是infra的效率、问题闭环的效率、训练模型的效率、数据的吞吐量,这是“内功”,没有聚光灯的照射,但厚积薄发。

他把这套方法论带到了具身。创立日冕之后,他没有选择做Demo竞赛,而是一头扎进AI服务器的生产车间,做能3个半小时上岗、越干越好的"硅基工人"。

在他看来,具身的GPT时刻没有办法在实验室里做出来——你得先进入真实的物理世界,拿到真正的反馈,在持续迭代中让基模的能力不断scaling。肖中阳自己,也像那个在车间里盯着机器人干活的人。他不急着宣称一个通用机器人时代的到来,他先花时间弄明白,一个"硅基工人"到底要怎样才能越干越熟练。"我要非常纯粹地先想这件事的成功需要哪些因素,然后把这个事情的成功跟自己绑定在一起。

"这话是他在蔚来时说给自己听的,现在,他和日冕的90多个人,正在这么做。

雷峰网原创文章,未经授权禁止转载。详情见转载须知。

分享:
相关文章

新智驾主编

专注蔚小理等造车新势力的原创报道 |微信:Gru1993
当月热门文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说