全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
业界 正文
发私信给小七
发送

0

对话星炽动力CTO李达——PULSE架构:如何让具身智能更像人?

本文作者: 小七   2026-07-24 23:03
导语:端云协同 + 原生隐私设计,家庭机器人兼顾智能与安全
对话星炽动力CTO李达——PULSE架构:如何让具身智能更像人?
端云协同 + 原生隐私设计,家庭机器人兼顾智能与安全

    编辑丨李希

                                                                                                       

今年关于具身智能的讨论里,有一个问题始终绕不开:机器人进了家门,到底靠什么让人愿意留着它?

工厂的逻辑很简单:干得准、跑得稳,得能运行,还能创收。但家庭场景不一样:一个动作失误、一次对意图的理解偏差,用户的心理容错率几乎为零——错一次,机器人就可能就被退货,或者放在角落吃灰。

这个现实,让行业分出了两条路。一条路上的公司,继续死磕物理智能,让机器人能够无限接近理解物理世界;另一条开始往回退一步,先想清楚一件事——机器人要怎么理解人,才能在人身边待得住。

星炽动力显然是后者。为了了解他们的想法,AI 科技评论和公司的 CTO 李达聊了聊。

李达的履历并不神秘。中科院自动化所博士,师从谭铁牛院士,长期做视觉导航和连续学习,成果多次在领域顶级期刊发表,上过 IEEE TIP。进入星炽动力之前,李博士曾在自动化所工作学习十余年,学术底子算得上扎实,但他现在做的,是把这些积累倒进一个家庭场景里,重新审视一个被忽视很久的问题:机器人如果不懂人,凭什么跟人一起生活?

今天的具身大脑讲的更多的是环境动力学’——但我们不光要考虑物理环境的变化,也要把用户的状态推演出来。讨论中,李达常常强调这一点。

为此,星炽动力推出的 PULSE 架构,是把具身大脑拆成了双轨:一条轨跑物理环境的感知和推演,另一条轨跑用户状态的感知和推演。两条轨不是孤立运行,而是在特征层面做交叉验证。

对话星炽动力CTO李达——PULSE架构:如何让具身智能更像人?

物理信息告诉机器人环境怎么了,用户状态信息告诉机器人人怎么了,两者合并,才能输出一个更靠谱的决策。

家庭场景里,人不是环境里的一件物体,而是交互的中心。如果机器人的认知模型里只有桌子、杯子、沙发,却没有坐沙发的人的状态,那它永远只能做一个被动的命令行工具——人发指令,机器执行,像在用 CLI(命令行)操作一台机器。

但在家里,如果老人、小孩没法很明确地提出指令,那么机器人是否就没法在家庭场景好好工作?

怎么让机器人理解人?PULSE 的答案落在三个关键词上:意图、信念、偏好

  • 意图是用户说了什么、做了什么,机器人能不能读懂。

  • 信念更有意思——李达举了一个例子:男主人认为牛奶还在微波炉里,但女主人已经拿出来了。男主人持有的是一个错误信念。如果机器人只盯着物理世界,它看到的是微波炉里没有牛奶,它不会理解男主人接下来要去做的动作是基于一个错误的前提。但如果机器人有能力表征人的信念状态,它就能主动提醒:牛奶已经被拿出来了。这种纠偏能力,才是家庭场景里真正有用的智能。

  • 偏好则更长期,涉及用户的习惯、边界、隐私,需要靠持续的交互来积累。

这三者构成的理解模型,不是挂在系统外的一个附加模块,而是被李达团队直接嵌入世界模型的条件化输入里。用户状态被表征为隐空间的特征向量,以类似 token 的形式参与跨注意力计算,和环境特征做对齐。

这个技术选择透露了一个清晰的价值判断:理解人和理解物理世界,在认知架构上应该是平权的,甚至人的优先级更高。

为什么?因为落地节奏不同。

物理世界太复杂,泛化太难。一个在80公分高的桌子上训练好的抓取模型,换到75公分的桌子上就可能失效。要在所有家庭、所有物品、所有光照条件下做到物理智能的通用,李达认为短期内难以实现。

但人的理解模型不一样。虽然人也复杂,但人的行为在单个家庭里是有规律的。一个人每天喝水的杯子、回家的时间、说话的语气,都有迹可循。如果机器人能先在一个具体的家庭里把这个人理解清楚,它的可用性就会迅速提升。

可用性上去了,用户的使用频率也就能够提升,拿着这些基于用户实际反馈的数据,星炽的机器人也可以借由这些和自家本体强耦合的真机数据,去进一步提升具身大脑的能力。

不追求一个模型解决全宇宙的问题,先让机器人在一户人家里不出错、不惹人烦、偶尔让人觉得贴心。这个目标比通用物理智能近得多。

PULSE 端云结合的落地策略也印证了这一点,云端负责全局迭代,端侧跑测试时适应——机器人在使用中遇到新分布的数据,直接在本地做调优,不用等云端回传。这种设计天然适配家庭场景:每个家庭都不一样,每个家庭的机器人都应该长出自己的理解模型。

说到底,物理智能解决的是能不能做到,而人的理解模型解决的是该不该做、什么时候做、怎么做才合适。在家庭这个容错率极低的环境里,后者的优先级恐怕还要再往前排一排。

这可能也是李达想表达的最核心的一句话:具身智能在家庭落地的关键,不是让机器人更像一个万能工具,而是让它更像一个懂得察言观色的伙伴。

对话星炽动力CTO李达——PULSE架构:如何让具身智能更像人?

以下是 AI 科技评论和李达的对谈实录,AI 科技评论做了不变原意的编撰。

AI 科技评论:能为我们讲讲 PULSE 架构的特点吗?

李达:PULSE个名字我们其实是有些寓意的。一方面,我们希望它是一个永续的、能够和人的价值对齐,并能够持续演进的系统。另一方面,"PULSE"这个词本身也有脉搏的意思。我们觉得机器人有了PULSE之后,就有了生命,也就能够真正地伴随用户一起成长。

如果用几个词介绍 PULSE 的核心闭环,就是:看懂环境,理解用户,双轨推演,接受反馈,持续进化。

当前行业内具身世界模型更关注环境动力学,也就是关注周围物理环境的演变。但是星炽动力主打 C 端家庭场景,就离不开和人的交互。所以我们希望能够让机器人具备社会属性

因此,我们在构建PULSE世界动作模型时,跨出了行业的第一步:不仅推演物理环境的变化,更要把“用户状态的变化”也推演出来。机器人在采取行动前,不仅要算清“杯子会不会掉”,还要推演出“这个举动会不会打扰到主人”。

我们最终的目的,是赋予机器人真正的“心智”,但什么是心智呢?人的心智,是他在一个团体当中,我应该知道怎么去做才能更好的融入团体。所以我们也希望机器人不仅可以执行命令,还要懂得主动预判你的需求,贴合你的偏好,并且极其克制地尊重你的家庭边界等等。

AI 科技评论:这可能和做情感还不太一样。

李达:纯粹的“情感交互”往往停留在语言层面,通过聊天提供情绪价值和陪伴;而我们在星炽动力要做的是通过“心智理论(ToM)”,将家庭场景中高度复杂的“个性化”,转化为一个可计算、可训练、可验证的数学模型。

这种基于心智的个性化模型,核心锚定在三个维度:信念(Belief)、意图(Intention)和偏好(Preference)。

偏好依赖于机器人的长期情境记忆,而“信念”则是机器人理解人类认知偏差的关键。我举个非常经典的家庭场景:男主人把牛奶放进微波炉加热后离开,女主人随后将其取出。此时,不知情的男主人脑海中就产生了一个“牛奶还在微波炉里”的虚假信念(False Belief)。当他再次走向微波炉时,具备心智模型的机器人就能精准识别出这种“信息差”,主动出声提示甚至直接递上牛奶,完成认知纠偏。

而在“意图”层面,我们不再满足于机器人只能听懂直接指令,而是要求它具备两项核心能力:一是“主动预判”,即通过用户的行为动作提前推断其潜在需求,做到“眼里有活”;二是结合“偏好对齐”,评估机器人的执行动作和分寸,是否真正符合该用户的心理期望。

为了支撑这套复杂的认知中枢,在前期构建用户状态表征时,我们引入了基于自解释增强的多模态大模型来进行底层建模。

AI 科技评论:要做个性化,记忆肯定是很重要的。

李达:是的,记忆是个性化的基石。为了兼顾机器人响应的低延迟与理解的深度,我们在PULSE的记忆模块上,设计了一套自适应任务复杂度的“三层记忆架构”:结构化规则层、RAG(检索增强生成)语义层,以及底层的参数化模型层。

比如最直观的结构化规则层,负责处理高确定性的物理时空检索。当用户问“我的剪刀呢?”,这是一个精准匹配的寻物指令,系统无需去激活庞大的底层模型做深层表征挖掘,直接在规则记忆库中调用即可。

但如果用户的指令是模糊或高度意图化的,比如只说了一句“帮我倒杯水”,这就触及了“RAG语义层”。光靠规则是无法匹配这句指令的,系统需要通过 RAG 从过往的历史交互切片(Episodic Memory)中,检索出与“倒水”相关的语境与习惯(比如用什么杯子、常喝的温度),以此对齐当前意图。

当面对更为复杂的长尾场景、深层的情感共鸣,甚至遇到毫无历史规则可循的突发状况(Zero-shot)时,就需要“底层模型层”的重度介入。通过大模型的认知推理与泛化能力,对长期沉淀的用户行为进行深度的因果归因与价值挖掘。这种层层递进的设计,确保了我们的机器人既能做到“极速响应”,又能做到“深思熟虑”。

AI 科技评论:不仅有记忆,还得有更好的上下文语境理解。

李达:对的,在家庭真实交互中,一句看似简单的“给我倒杯水”,本质上是一个“高维且高度模糊”的指令。它隐含了海量的决策分支:水温多少?什么杯子?纯净水还是电解质水?这些信息无法单纯靠死记硬背来提取,机器人必须具备基于时空上下文的意图消歧能力。

这种能力的底层支撑,是我们PULSE架构中的“室内态势协同感知”模块。比如,当用户大汗淋漓地推开家门说“倒杯水”,机器人不应该只是机械地去接一杯温水,它需要瞬间完成两个维度的态势融合:

第一是物理环境感知,通过物联网或环境传感器,获取当前的极热天气与室内高温状态;第二是用户状态感知,通过第一视角的视觉模型捕捉“满身是汗”的特征,甚至结合毫米波雷达提取呼吸心率等生理信号。

获取这些多源异构数据在硬件层面并不难,真正的技术壁垒在于后端的多模态融合与跨域决策。基于这套感知,机器人不仅会决定递上一杯补充电解质的运动饮料,还会联动全屋智能生态——比如我们目前已经与海尔智家、涂鸦智能深度打通,机器人可以自主指令空调下调温度。

因此,我们把室内态势感知明确划分为物理环境和用户状态两个维度。这两部分的感知结果,将共同作为输入,接入后续的世界动作模型。而这正是我们提出的"双轨世界模型"的核心:既要对物理世界的演变进行推演,也要对用户状态的变化进行推演。只有将这两者并行处理,机器人才能在家庭场景中真正理解人的需求。

AI 科技评论:另一方面其实对于具身来讲,只有正确数据是不是足够了?

李达:远远不够。在具身智能的真实落地中,“正确的常识”只能保证机器人能走通基本流程,而真正的护城河,恰恰是那些“错误数据”、“纠偏数据”以及“长尾的分布外数据(OOD)”。机器人在用户即时纠错中产生的反馈数据,才是我们做后训练(Post-training)最珍贵的燃料。

PULSE架构的数据回流设计中,我们将这些反馈分成了两条线处理:一条是云端的全局迭代,用于基础大模型能力的长期对齐与泛化;但更关键的是另一条线——端侧的测试时适应(TTA, Test-Time Adaptation)。机器人必须具备实时的不确定性估计(Uncertainty Estimation)与OOD检测能力,一旦识别出歧义数据,就能快速让模型适应新的数据分布。这对机器人的纠偏速度要求很高,因为家庭场景里用户的心理容错率极低——错一次,可能就被退货或闲置。

所以在策略上,我们就需要非常谨慎,不能因为历史数据里用户曾经这么做过,就替用户直接把任务完成了。人的状态有起伏,情绪可能多变。当机器人分析出当前执行某项任务的不确定性较高时,应该主动询问用户:"我帮您把这件事做了,行不行?"如果用户同意,再执行;如果用户表现出不耐烦,就静默处理。

最理想的闭环是,机器人在完成每一个决策或动作后,能够实时捕获用户的多模态显隐式反馈。无论是愤怒的微表情、不耐烦的语气,还是竖起大拇指夸一句“你真棒”,系统都会将这些自然流露的信号回传,转化为偏好对齐模型中的正负奖励。这才是具身大脑“越用越聪明、越用越懂分寸”的本质路径。

AI 科技评论:后训练对你们来说是一个很重要的策略。

李达:我觉得后训练肯定很重要,但这个要分时期来看。

认知仿生学的角度来看,人类成长是一个增量学习的过程,我们在掌握一项新技能时,是基于已有的常识基座进行局部的突触链接调整,而不是把从小到大的所有记忆翻出来“全量重训”一遍。具身大模型的后训练,本质上就是模拟这种人类的“终身学习”机制——在新家庭、新场景中,以极低的算力成本对齐新的偏好。

但我们也非常客观看待现阶段的技术局限。当后训练走向极致,也就是真正意义上的“连续学习(Continual Learning)”时,不可避免会面临灾难性遗忘问题。

这是一个非常现实的风险:如果模型一直接收新知识、不断进行微调,那些此前好不容易建立起来的基础通用技能,会不会因为网络权重的覆写而丢失?这就像俗话说的“狗熊掰棒子”,学了新的家庭习惯,却忘了最基础的物理常识。这种风险不仅存在,而且在现有的大模型架构中概率极高。因此,如何在“敏捷吸收新知”与“稳固历史常识”之间建立有效的参数隔离与记忆重塑机制,也是我们当前在工程落地上投入极大精力去攻克的难点问题。

AI 科技评论:今天星炽动力怎么看具身大脑的泛化?我们距离实现动作的即兴和举一反三还有多远?

李达:当前行业距离真正泛化还有相当长的一段路要走。

现在很多VLA模型,一旦物理参数变了,比如实验室精调时桌子高度是80公分,到真实家庭变成了75公分,它大概率就不知道该怎么抓了,这说明现阶段的泛化是非常脆弱的。如果大家只是在实验室里闭门造车,死磕算法架构,这永远是个无解的死循环,因为我们根本穷举不完真实家庭里千奇百怪的参数。

所以,星炽动力破局的思路,是紧紧贴合我们“本体+大脑+数据”三位一体的战略飞轮。我们不寄希望于某种神奇的算法能立刻实现通用泛化,我们走的是用规模换数据、用数据反哺模型泛化的务实路径。所以星炽动力的模型,一定能率先在星炽自己的硬件本体上实现最稳健的泛化。

至于未来动作的即兴编排,那是在我们的原子库泛化能力足够强之后,依靠上层大模型规划和底层具身OS调度来自然实现的水到渠成。

AI 科技评论:隐私问题我们会怎么考量?

李达:隐私绝对是C端家庭机器人的生死线。在星炽动力,我们对隐私的考量不仅停留在“获取用户知情同意(Consent)”这种合规底线上,更是将隐私保护机制直接原生地设计在了PULSE的技术架构里,也就是所谓的“Privacy by Design(隐私即设计)”。

具体来说,我们通过“端侧计算”和“模态解耦”来彻底切断隐私泄露的源头。

首先,在核心的行为理解上,我们不需要把包含用户真实面貌、穿着的RGB高清画面传回云端。在端侧,我们就直接将视觉流转化为了低维的骨架点(Skeleton/Pose)信息。脱敏后的骨架序列,在行为识别算法上的性能反而更好!因为衣着纹理、背景光影在很多时候是冗余的噪声,剥离这些反而让模型更专注、更鲁棒。

其次,对于人脸微表情、生理状态这些极度敏感但算力要求不高的感知任务,我们全部在前端直接闭环处理。系统最终传给云端大脑的,只是几个类似于“高兴”、“疲惫”的结构化语义标签,没有任何原始图像。

环境数据也是同理。我们不需要上传用户家里的照片来做预演,我们提取的是场景的结构化语义描述(Semantic Scene Graph)。云端拿到的只是一组描述物体空间关系的文本和拓扑图。

AI 科技评论:谢谢李博的分享,我们再问最后一个问题:星炽动力的 Mission 是什么?

李达:让机器人真正走进千家万户。我们聚焦家庭场景,希望打造一款在长期陪伴中不断学习、越来越懂你的家庭伙伴机器人,让机器人更自然地融入每个人的日常生活。

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说