全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
人工智能 正文
发私信给郑佳美
发送

0

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

本文作者: 郑佳美   2026-08-17 16:46
导语:HiDream-O1-World,一款原生全模态交互式世界模型。

HiDream-O1-World,一款原生全模态交互式世界模型。

HiDream-O1-World 具备漫游、编辑、交互三大功能,支持文本、图像、交互等多模态方式输入。用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。

HiDream-O1-World 搭载的是智象自研的原生全模态(UiT)架构。作为核心基座,UiT此次迎来升级,在交互式世界模型领域公认的核心技术挑战——时空一致性与物理一致性上,取得了关键性突破。在新发布的世界模型中,这种突破表现为:当镜头推拉摇移时,场景空间的几何结构保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。

智象未来CTO姚霆表示:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。HiDreamO1World,正是这场系统性重塑的第一道桥梁——让每一次交互,都通往一个从未抵达的世界。它的突破性效果,既坚定了我们推动原生全模态架构技术路线纵深发展的信心,也为智象持续构建世界模型的核心技术壁垒提供了关键支撑。”

不久前,HiDream-O1-World 在第三方评测中交出了首份成绩单。由美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench公布了最新榜单。智象HiDream-O1-World在核心的Navi分榜中,以平均分80.9的成绩登顶榜首,其中在物理(Physical)维度以73.3分位列第一,Consistency(一致性)维度达88.0分。两项关键指标均位居前列,成为该榜单中综合表现排名第一的模型。

 原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

WBench是业内首个面向交互式世界模型的系统性评测基准,涵盖289个多轮交互案例、共计1058个交互轮次,并基于五大维度、22项指标构建起一套严谨的量化评测体系。评测分为Navi与Full两个榜单,其中Navi分榜聚焦空间导航与视角控制,被业内视为衡量世界模型空间理解能力的核心标尺。HiDream-O1-World首次参评即登顶Navi分榜,刷新交互式世界模型性能上限。这背后,是智象自研UiT架构在时空一致性与物理一致性上的关键突破,让“构建可信交互世界”有了坚实的技术支点。

02. 一键生成世界,开启沉浸式交互体验

模型支持文本、图像、交互式操控等多模态输入方式,用户只需一段文字描述、一张图片或简单交互,即可一键生成结构完整、质感细腻、风格多元的交互世界。对用户而言,这不只是“进入”一个世界,而是亲手“创造”一个世界。比如,上传一张室内照片,模型便能快速构建出高精度的数字孪生空间,自动补全整间卧室的全景图——空间比例精准协调,画面细节精准且质感十足,令人仿佛置身其中。

 

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

 在功能上,模型提供了第一人称和第三人称两种视角的漫游体验。用户可自由驱动角色行走并任意调整视角方向。以潜水场景为例,视角移动时,水面光影与海底碎光同步变幻,珊瑚礁色彩分明、鱼群游弋自如。镜头拉近后珊瑚的纹理细节清晰可见,画面全程稳定无漂移。

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

不止于漫游,HiDream-O1-World  赋予用户实时编辑能力。用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。这并非简单的局部微调,而是基于几何、光照、材质到物理逻辑的全局统一,确保每一次交互都真实自洽。

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

强大的泛化能力,是HiDream-O1-World构建多元交互世界的基础。

模型支持人类、动物、虚构角色等多种角色的构建。无论是街头漫步的行人、空中盘旋的飞鸟,还是幻想中的异兽,模型都能精准适配其形态与运动,让每一种角色都踩准自己“应有”的节奏。以登雪山的场景为例:登山人行进中,脚印在雪面上压出真实凹陷。雪花随风飘落的动作缓急有致。远处群山轮廓与脚下岩石纹理随视角推移,衔接得非常自然。

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

模型还拥有极其丰富的场景与风格化创造空间。它既可高度还原真实城市街景、自然地貌、室内空间等各类实景,让光影、材质、空间结构高度贴合现实物理世界;亦可自由解锁幻想异世界、二次元卡通、3A游戏渲染等多元艺术风格,轻松打造极具想象力的风格化数字场景。虚实之间,游刃有余。

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

03. 两大核心突破:长时程的时空一致性与物理一致性

交互式世界模型长期受制于空间、物理与记忆三大核心难题。动态交互中,相机视角切换常引发画面模糊畸变、场景漂移乃至空间结构紊乱,三维形态难以维系;同时,画面中也极易出现人物穿墙、物体悬浮等,明显违背物理规律的情况,会严重折损场景的可信度;而更棘手的是,模型缺乏长效记忆——视角稍作转动,已生成物件便可能凭空消失或细节飘忽,世界状态始终无法被忠实留存。这三重挑战彼此纠缠,共同构成模型从即时生成迈向持续存在的根本壁垒

HiDream-O1-World基于自研原生全模态(UiT)世界模型架构,在上述挑战上实现了关键突破。在长时程交互中,画面严格遵循物理法则,视角切换间始终保持了高度的空间稳定性。这一能力的实现,依托于两大核心能力的协同支撑:时空一致性与物理一致性。

长时程时空一致性

HiDream-O1-World的核心突破,在于将“3D先验注入Memory上下文”与“Test-Time Training在线维护”进行协同设计

传统世界模型如同“画师逐帧作画”——每次交互都要重新绘制整幅画面,几何与外观深度耦合,任何微小偏差都会在长序列中被不断放大,最终导致物体漂移、形变甚至凭空消失。HiDream-O1-World则如同一位拥有“空间记忆”的导演:每到一个新场景,模型不是每步重新揣测环境,而是在Memory中持续记录场景的空间结构;当镜头移动或视角切换时,依据这份记忆快速调取对应视角下的场景呈现,再通过实时的在线微调确保每一次生成都准确无误。镜头推拉摇移之间,物体不消失、不漂移、不“失忆”。

WBench的Consistency(一致性)维度,HiDream-O1-World得分88.0,位列榜单前列,也充分印证了“Memory+TTT”架构在长时序交互中维持3D几何与空间一致性的出色能力

全局稳态物理一致性

为实现物理层面的一致性并确保画面符合现实逻辑,模型从训练数据与推理机制两端同时着手,形成合力。

训练阶段——物理模拟数据驱动的归纳偏置学习

推理阶段——Test-Time Training在线适应物理场景

TTT机制不仅作用于3D维度,同样为物理一致性提供在线增强。在交互过程中,模型通过轻量级在线自适应,能够针对当前场景的特定物理属性进行快速微调。例如,当场景中出现新物体类型或材料时,模型可在推理中动态调整内部表征,使后续生成帧更好地符合该场景特有的物理规律——如水的流动性、刚体的碰撞响应等。这种“边交互边适应”的能力,使模型即使在训练数据未完全覆盖的物理情景下,依然能保持较高的物理合理性。

这种“架构创新”与“数据策略”双轮驱动的设计,使HiDream-O1-World在物理模拟真实感上带来了实质性突破——在评估画面运动是否符合常识物理的视觉合理性评测中,模型相比行业平均提升13.6%;在更具挑战性的因果保真度评测中,通过对流体、碰撞、形变等物理维度的全面衡量,模型同样实现了12.7%的大幅跃升。

值得一提的是,这一技术路线已获得国际顶会认可。聚焦空间一致性研究的论文,正式入选2026年欧洲计算机视觉国际会议(ECCV* 2026),为交互式世界模型在三维空间理解与长时序生成方向上,开辟了一条兼具理论原创性与工程可行性的技术路径。

*ECCV(European Conference on Computer Vision):全球计算机视觉与人工智能领域的三大顶级学术会议之一,每两年举行一届。

论文标题:DreamWorld: Geometry-Grounded 

Video Diffusion for 3D-Consistent World Modeling

项目主页:https://yanghb22-fdu.github.io/DreamWorld

04. 三大全新产业格局,向新世界开启

除了技术突破之外,HiDream-O1-World也正在打开智能时代全新的产业重塑可能性。

1. AI互动影游——开启互动影游智能化新阶段

AI互动影游是以影视级视听叙事为外壳、用户交互为内核的新兴内容形态。然而,实现二者的高效统一,一直是制约行业升维的核心瓶颈。HiDream-O1-World交互式世界模型的发布,让我们看到了这一命题的全新可能性——用户不再被动跟随线性剧情,而是成为叙事的主动参与者,世界会随其探索持续沿着不同的分支剧情演进。由此,用户在影视级视觉质感中获得前所未有的沉浸感,并享受探索多重结局的乐趣。

2. 具身智能仿真——打造高精度仿真底座

HiDream-O1-World世界模型能够高效搭建高度还原、遵循物理规则的城市、工厂、室内等多类型仿真空间,为智能机器人训练、自动驾驶、智能制造等场景提供高质量的虚拟试验底座。这意味着,高成本、高风险的实景测试可由智能仿真替代,加速具身智能产业发展。

3. 3D场景生产——从创意捕捉,到微观世界推演

面向创作者与设计师,HiDream-O1-World能轻松生成3D手办、家居场景及艺术空间等内容,结构完整、细节丰富,并支持结构微调、风格秒换与智能补全,有效缩短创意到成品的迭代路径。更具想象空间的是其向微观世界的延伸:借助HiDream-O1-World生成高精度的微观世界,可以精准模拟细胞行为、蛋白相互作用等生命过程,为药物发现与疾病机理研究开辟全新的数字仿真路径。

当物理世界可以被一键生成、自由交互,很多行业都值得被重新想象。这些领域,还只是冰山一角。随着开发者与创作者不断加入,交互式世界模型的应用边界,将远超我们今天所能描绘的范围。


原生全模态路线进阶,智象未来发布交互式世界模型HiDream-O1-World

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说