全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
业界 正文
发私信给陆毅
发送

0

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

本文作者: 陆毅   2026-09-23 18:31
导语:AI 视频的下一战:谁能让世界保持运行
越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题
AI 视频的下一战:谁能让世界保持运行

    作者丨Reah

    编辑丨李娜 岑峰

                                                                                                       

大语言模型已经用 Scaling 证明模型、数据和算力可以持续换来更强能力,必须一边生成、一边回应用户的实时世界模型,能不能也走上这样一条路?雷峰网(公众号:雷峰网)
越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

2026 年 1 月,爱诗科技提出“通用实时世界模型”这一产品方向,并推出 R1。目前,PixVerse R2 已全量上线用户可以直接进入网页端体验动作指令和互动影游的相关交互

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

01


实时世界模型,

能走上 LLM 的 Scaling 之路吗

过去几年,Scaling 最具确定性的成功故事来自大语言模型。随着模型容量、训练数据和计算规模持续扩大,语言模型获得了更强的理解、推理与泛化能力,“越大越强”也由此成为大模型产业最重要的认知基础之一。

但如果把这条经验迁移到世界模型的话,问题就复杂很多,不能只是简单地继续放大视频生成模型。语言模型可以在接收问题后集中计算再给出答案,但实时世界模型却必须一边运行,一边接收用户的动作、文字和声音,同时继续输出连贯的音视频内容。

于是这形成了一组长期存在的矛盾:实时要求模型足够快、足够高效,通用则要求模型足够强、见过足够丰富的世界。模型能力向上扩展,计算负担就要随之增加;如果为了速度持续压缩能力,实时体验又容易停留在只能完成有限演示的专项模型。

为什么实时世界模型不能简单复制 LLM 的 Scaling?为什么“快”和“强”会互相拉扯?PixVerse R2 给出了自己的答案——把能力与效率拆成两层推进,具体的实现机制我们会在后文展开更详细的讨论。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

R2 将五类增长纳入同一可扩展框架,使生成质量、长程一致性和多模态控制能够共同提升

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

02


一次生成,

怎样变成一个持续运行的世界?

进入 PixVerse R2 实时生成的世界“冬日宫殿”,用户面对的是一个真实仍在运行的世界。WASD 和方向键用于控制移动与视角,新的指令可以继续改变当前体验;每次操作之后,页面不会退回独立的生成流程,用户仍然留在同一个世界里,决定下一刻发生什么。

技术报告中的 Scaling 最终需要回到产品端接受检验:它能否让用户真正进入一个世界,而不是在一段视频上叠加几个控制按钮?

为此,我们除了进行实机体验,还进一步分析了冬日宫殿会话的 HAR 网络记录。HAR 可以被理解为浏览器网络活动的飞行记录仪,它虽然没办法直接看见模型内部,但能帮我们记录一次产品会话究竟怎样被组织。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

本轮会话最关键的事实是客户端全程只观察到一次 session_init 和一次 generation_started。此后八轮系统推荐 Prompt 共享同一条内容流,提示历史从第一轮连续累积到第八轮,客户端没有为每一轮输入重新预约资源、初始化会话或切换媒体通道。约 119.5 秒的生成窗口里,所有操作都被组织在同一条持续 session 中。

这意味着,从用户可见的产品流程看,八轮 Prompt 并不是八个彼此独立的视频任务拼凑起来的,而是当前世界下一步如何变化的连续控制输入。也就是说,一次生成不再以交付文件为终点,还要成为后续行动不断发生的环境。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

多轮输入持续发生在同一产品会话;该数据反映客户端协议,不外推服务端内部子任务

在同一会话中,HAR 还记录到 3,355 条结构化 action_frame。这些动作帧的发送间隔中位数约为 29.944 毫秒,折算频率约 33.4Hz。用户按住 W、组合方向或调整镜头时,客户端持续发送的是一条高频、低层控制流,而不是把“向前走”转写成一句偶尔触发的文字命令。

这看似只是交互细节,实际对应着世界模型产品化的重要分水岭。传统 AI 视频中的 Prompt 决定内容大致长成什么样,而在持续世界里,Action 决定用户此刻正在做什么。

当 Prompt 和 Action 能够进入同一个运行过程,用户与模型的关系才会从提出要求、等待结果,进一步变成进入环境、持续行动。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

WASD 以高频结构化 Action 流进入实时会话,而不是被转写成一条文字 Prompt

语言与动作也不需要轮流占用这个世界。每轮 Prompt 从发送到 prompt_generated 大约经历 3.9 至 4.5 秒;在第三至第八轮中,Prompt 发出后约 8 至 26 毫秒,Action 就继续进入控制通道,每个对应窗口内又持续发送了约 129 至 152 条动作帧。

也就是说,处理语义指令时,WASD 通道仍然保持开放,两类输入可以同时进入一条运行中的世界会话。

这正是“多模态控制”从技术名词走向产品体验的关键一步。它让用户不必在动作模式和语言模式之间反复切换,可以在移动、观察和探索的过程中继续发出新的语义意图,为边行动、边改变世界的体验建立真实通道。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

Prompt 处理期间,Action 仍持续进入同一会话;该图证明协议并行,画面效果由连续录屏补充

延迟数据进一步说明了这条实时链路怎样工作。八轮推荐 Prompt 发出后,服务端 prompt_updated 的中位耗时约为 1.33 秒,与爱诗所说的“约 1—2 秒响应”处在相同区间;完整 prompt_generated 事件的中位耗时约为 4.27 秒。

前者代表当前世界流中的指令状态已经更新,并不等同于用户恰好在 1.33 秒看见完整目标变化,但它说明从接收、审核到世界流更新,R2 已经建立起一套秒级 Prompt 协议链路。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

R2 的 Prompt 响应分为多个协议阶段;1.33 秒是协议更新时间,不等同于完整视觉执行耗时

冬日宫殿也展示了 R2 当前对外开放的产品形态。初始化消息显示,它由一张首帧和 345 个字符的 world setting 启动,同时配置了风格、音乐和 Action 等基础信息,并未设置 preset_video_uri。从客户端可见流程看,页面没有播放一段预置底片,而是通过 pipeline=r2 返回持续生成的实时媒体。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

Winter Palace 从首帧和世界设定启动,由 R2 pipeline 持续返回实时媒体

综合来看,World 层已经把官方所说的控制信号与时间尺度 Scaling 外化成同一产品会话里的 Text、Action 和持续媒体。

更多输入不再意味着更多彼此割裂的生成任务,而是共同作用于一个仍在运行的世界。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

03


世界能力,

怎样被组织成一段更长的叙事?

如果说冬日宫殿展示的是“世界怎样持续回应用户“,那么互动影游 Zero Mark 展示的,则是这套能力“如何进入一段更长、更有结构的内容产品”。

两者在界面上已经呈现出明确分工:World 直接提供 WASD、镜头和 Prompt,强调自由移动与即时变化;Story 则以结构化剧情选择和电影化演出组织长叙事,同时保留文本入口,为固定分支之外的变化预留空间。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

HAR 进一步确认,两者采用了不同的产品 pipeline。Winter Palace 运行在 r2 pipeline 中,Zero Mark 则使用 director pipeline。后者维持了一条约 20 分钟的长 session:53 次有效状态响应始终指向同一脱敏 session,状态保持为 ACTIVE,媒体通道也没有改变。同一长会话中还出现了多次媒体轨道分段切换,与 Director 的段落化编排形态相吻合;页面记录则确认了多次结构化剧情选择,以及一次文本入口点击。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

World 强调持续生成和低层控制,Story 强调长叙事的编排与节奏,两者承担不同产品任务

Zero Mark 展示的是一条用 Director 维持长叙事的产品化路径。在本轮网络记录中,同一会话里同时出现了结构化选择、实时媒体,以及八段预先准备的 1080p、24fps 关键电影资产。它们共同守住关键叙事节点的节奏与电影完成度,并为世界模型提供的开放变化留下入口。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

这种分工让生成式内容更接近一个可稳定交付的互动产品。World 提供脚本难以穷举的开放性,Director 负责把变化组织进剧情结构,关键资产则确保重要演出具有稳定完成度。

任务与时间尺度的 Scaling,因而不只体现为模型能生成更多画面,也体现为模型能力开始被组织进一条更长、更完整的互动叙事。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

Zero Mark 以 Director 长会话组织关键电影资产、结构化选择与实时媒体,使长叙事兼顾开放性、节奏与完成度

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

04


技术解法:

R2 如何让能力与效率不再互相妥协?

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题
PixVerse R2 上线后迅速登上twitter 热度总榜
我们在产品端看到的是一个持续会话,模型层要解决的则是能力如何扩展、扩展以后又如何保持实时。过去的多阶段路线往往需要在不同模型和训练目标之间反复迁移,每增加一种任务、数据或控制信号,都可能增加系统复杂度,并折损上游已经获得的画质、运动、控制和长程能力。

PixVerse R2 给出的答案是把能力与效率拆到两个层次分别推进:Omni Causal AR 负责持续抬高世界模型的能力上限,Real-Time Acceleration 再把上游能力带回低延迟、可交互的运行区间。按照官方定义,R2 的 Scaling 同时发生在模型容量、数据、任务、控制信号和时间尺度五个维度上,最终转化为用户能够感知的三类结果:更高的生成质量、更强的长程一致性,以及更丰富的多模态控制。

这也是“越大越强不再是 LLM 的专利”真正对应的技术命题。R2 并不只想在现有能力与速度曲线上寻找一个折中点,而是希望通过分层架构,让实时通用世界模型拥有一条可以继续扩展的系统路径。

Omni Causal AR 是 R2 的能力引擎,目标是把文字、参考图、声音和 Action 纳入统一的因果世界模型。它用 Dynamic Chunk 适配不同控制信号的时间粒度,通过分层的历史与对象状态机制维持长期锚点、近期动态和关键对象,再借助 Error Bank 等设计,让模型学习如何从已经发生的偏差中继续运行。

这一层负责持续吸收更多模型容量、数据、任务、控制信号和时间尺度,把世界模型的能力上限尽可能做高。

Real-Time Acceleration 则是加速引擎R2 不让一个新的少步模型从头学习整个世界,而是从同一个 Omni Causal AR 基础初始化 Student 与蒸馏 Teacher,再通过同源蒸馏、稀疏计算和金字塔式少步生成,将上游已经获得的生成、控制和长程能力尽可能完整地带回实时区间。

按照官方公开口径,这套系统还试图把世界模型压缩到消费级单卡可以实时运行的范围,使更强的基础模型不必天然意味着更远离用户的离线演示。

这就是品牌方所说的从五层接力到两步直达:先穷尽能力边界,再攻克效率边界——让能力与效率分工,而不是让一个模型永远在质量和速度之间做静态妥协。官方技术材料解释了内部训练与加速机制,本轮测试中 HAR 则从产品端说明,这条路径已经能够承载持续会话、高频 Action、多轮 Prompt 和实时媒体。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

R2 先扩展世界模型能力上限,再通过独立加速层将能力带入低延迟运行区间

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

05


从文件到 Session:

世界模型真正改变的是什么?

PixVerse 为什么走向实时世界?模型、C 端与实时系统

爱诗走到 R2,首先源于对问题的不同定义。它没有去持续追问怎样再生成一段更长的视频,而是去思考怎样让生成内容成为一个用户可以进入、可以行动、还愿意继续停留的世界。

R1 先把生成视频转变为持续交互过程,R2 再把扩大能力上限与压入实时运行拆成两个层次,这条演进路线从一开始就同时包含模型问题与产品问题。

AI 视频基础模型为这条路线提供了高质量生成起点。PixVerse 长期面对的是人物、镜头、运动、风格和叙事等真实创作需求,因此在进入世界模型时,天然更关注视觉完成度、内容表达和复杂场景。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

PixVerse WASD 实时世界体验录屏

爱诗的 C 端和出海基因,则让实时世界模型更早进入真实使用。按照官方口径,PixVerse 已拥有全球 1.5 亿用户,并从 2026 年 1 月起向普通用户开放世界模型体验。用户会连续输入,会在系统仍在运行时继续操作,也会用意想不到的方式探索能力边界。真实产品场景因此能够更早暴露问题,并持续为产品与模型迭代提供反馈。

与此同时,一次可用体验还需要资源调度、实时控制、内容审核、音视频传输、会话管理和结果归档共同工作。

爱诗同时积累生成算法与大规模实时系统工程,使它能够把实时世界模型从研究能力转化为普通用户点开就能进入的环境。C 端实时服务又会把延迟、并发和单位算力成本直接变成产品约束,因此 Real-Time Acceleration 不是基础模型完成后的附加优化,而是整条路线本身的一部分。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

R2 同时面向普通用户、开发者和内容创作者开放,实时世界模型由技术预览走向真实产品反馈

世界模型正在竞争什么?

世界模型正在沿几条不同路线快速抬高能力边界。Google DeepMind 的 Genie 3 强调高分辨率、数分钟一致性与 Agent 训练;Decart Oasis 3 把低延迟、多视角和 Physical AI 部署作为重点;World Labs Marble 选择先生成可持久、可编辑和可导出的显式 3D 世界;HappyOyster、Odyssey 等路线,则分别向实时漫游、导演模式和通用交互视频推进。它们分别代表能力、部署效率、显式空间和产品形态的不同方向。

如果用能力与通用性作为横轴,用实时交互效率与产品可运行性作为纵轴,传统方案往往需要在一条曲线上选择位置:更强的模型可能运行得更慢,更快的模型又可能只覆盖少量任务。R2 通过 Omni Causal AR 与 Real-Time Acceleration,让能力和效率拥有可以分别推进的结构;它希望做到的,不只是在现有曲线上找到一个更好的静态坐标,而是让整条曲线具备继续向右上移动的可能。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

更强的模型可能运行得更慢,更快的模型又可能只覆盖少量任务

R2 的产品落地也构成了这套技术坐标的一部分。它不只提出两层 Scaling 框架,还把 Action、Prompt、实时媒体、Director 长会话、C 端入口和 API 放进实际产品系统中。它的差异不仅来自一个新模型,也来自把模型、运行时和消费产品共同设计的路径。

当内容从文件变成 session,生成式娱乐会怎样变化?

AI 视频与实时世界模型最根本的差别肯定不在于多了几个控制键。AI 视频的产品单位是文件:用户输入、等待,然后获得一个可保存、可剪辑、可传播的结果。实时世界模型的产品单位则开始变成 session:用户进入、行动,世界持续回应;会话结束后仍然可以归档一段视频,但视频已经从最终目的变成这段共同经历的记录。

当内容单位从文件变成 session,行业关注的指标也会随之变化。单帧画质和成片时长依然重要,但输入到反馈需要多久、状态可以维持多长时间、用户能否基于刚才的变化继续行动、一次偏差后能否继续运行,以及一条 session 能否容纳更多角色、任务和参与者,都会成为新的产品竞争变量。世界模型创造的价值是让内容能够在每个用户使用它的当下持续变化。

由此,一套生成式娱乐技术栈开始变得清晰:World Model 提供开放世界的生成与模拟能力,Agent 或 Director 负责理解意图并维持任务与叙事结构,Runtime 管理状态、输入、媒体和实时反馈,Assets 与 Rules 则守住关键内容的完成度、安全性和可控性。这是从当前产品现象中抽象出的产业框架,而不是 PixVerse 官方公布的服务端拓扑;它说明基础模型决定上限,产品架构决定这些能力能否被稳定消费。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

该图根据产品与 HAR 现象形成,用于说明世界模型从能力走向内容产品所需的系统分工

今天,普通用户先进入官方搭建的世界,创作者与 PixVerse 共建互动影游;接下来,API 和更完整的创作工具有机会让游戏、互动影视、直播、营销与虚拟角色团队定义自己的世界设定、剧情锚点和可生成区间。生成能力带来的不只是少制作几段素材,而是让同一份内容面对不同用户时,可以当场生长出不同过程。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

PixVerse WASD 实时世界体验录屏

再从长期看,如果模型能够继续容纳更多任务、控制信号和时间尺度,Runtime 又能支撑更长会话、更多参与者与跨终端状态,那么世界模型就可能从内容工具进一步变成生成式数字世界的基础设施。R2 已经开放了一组用户可以直接进入的产品起点,并让这条路径获得了真实体验:生成不再只负责生产结果,也开始负责维持环境。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

06


R2 还没有解决什么?

目前,R2 还不是一套已经完成的游戏引擎,也不是用户可以从零创造一切的完全开放世界。实测中,从点击 Explore 到首帧可见,耗时约为 7.86 秒,其中包含资源预约、页面加载、连接实时服务和首轮生成;进入世界后,推荐 Prompt 的 prompt_updated 协议事件中位耗时约为 1.33 秒,完整 prompt_generated 事件中位耗时约为 4.27 秒。第一次进入世界和进入后的指令响应,已经成为两条可以分别优化的产品链路。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

从模型 Demo 走向面向大规模用户的产品,下一阶段的考题将自然转向冷启动、资源调度、长会话稳定性和单位算力效率。Scaling 的意义,也不只是让模型在理想条件下变得更强,而是让这些能力能够在真实约束中持续服务更多用户。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

07


当一次生成不再结束,

实时世界模型会走向哪里?

Winter Palace 的两分钟会话说明,R2 已经把三千多条动作帧和八轮推荐指令组织进同一个持续 session;Zero Mark 则展示了 Director 长会话如何进一步为开放能力补上叙事结构与电影完成度。

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题

越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题
PixVerse WASD 实时世界体验录屏
AI 视频是一种工具:输入、等待,然后得到结果。实时世界模型则开始成为一种环境:用户进入、行动,世界不断回应。当这套能力沿着统一架构继续吸收更多任务、信号和时间尺度,它还可能进一步成为下一代生成式数字世界的基础设施。

真正改变一个时代的技术是找到一条可以持续变强的路。R1 让视频开始实时回应人,R2 则让这个世界拥有继续变强的路径。越大越强不再是 LLM 的专利,世界模型也终于走到了自己的 Scaling 时刻。


雷峰网原创文章,未经授权禁止转载。详情见转载须知

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说