2026年9月23日,继上月披露研发进展后,全球领先的AI视频大模型公司爱诗科技(AIsphere)正式发布全球首个具备 Scaling 能力的通用实时世界模型PixVerse R2,并向用户开放包括游戏、互动影视及数字人等多个场景体验间。基于爱诗自研的 Omni Causal AR(全模态因果自回归)与 Real-Time Acceleration(实时加速)两层架构,通用实时世界模型第一次像大语言模型一样,拥有了一条清晰、确定、可以被验证的持续扩展路径。爱诗科技创始人及CEO王长虎表示,随着持续Scaling(规模化扩展),PixVerse R2将从当前的创作工具,逐步发展为可随时进入、随时互动的生成式环境,最终成为下一代生成式世界模型的基础设施。

(图:PixVerse R2 上线后迅速登上X(twitter) 美区热搜)
通用实时世界模型首次建立Scaling 路径
ChatGPT用Scaling Laws(规模定律)证明了“模型越大、能力越强”后,整个AI行业都在追问:这条定律是否只属于文字?
过去普遍认为,只有语言这种“离散符号”才适合规模定律,而视频是“连续高维信号”,天生难以扩展。Sora的出现打破了这一偏见,但实时世界模型领域仍面临棘手难题:要实时,模型就必须做得够小、够快,才能在一块显卡上跑出流畅的帧率;要通用,模型就必须做得够大、见识够广,才能理解各种复杂的场景和物理规律。因此,过去的技术路径往往需要在两者间取舍,几乎没有人真正走通Scaling(规模化扩展)。
爱诗科技坚信,真正可扩展的通用实时世界模型不该一直在“能力”和“速度”间二选一,应该建立一条能够将两者解耦的技术路径。只要架构设计对了,当文本、参考、声音、操作这些复杂信号都能被模型统一“理解”,实时世界模型同样可以“越大越强”。PixVerse R2即验证了这一点,“实时”和“通用”不仅可以兼得,而且实时不是“偷工减料”的妥协,而是一条可以持续变强的技术路线。
PixVerse R2 核心能力全面提升
以往行业谈论Scaling(规模化扩展)时,往往只意味着参数变大。但在PixVerse R2,它发生在五个维度上:

(图:PixVerse R2 的Scaling维度与改变)
这五个维度并非各自为战,而是在同一个模型里相互增强,最终一起转化成通用实时世界模型核心能力实实在在的提升:
生成质量更高——画面更精细、运动更自然、音视频同步更精准
长程一致性更强——角色不崩、场景不跳、物体不凭空消失,世界状态在长时间运行中保持稳定
多模态控制能力更强——文字、参考图、声音、键盘操作,都能被模型稳定地“听懂”并做出反应
所以,PixVerse R2 不只是“一个更大的模型”,它是一套可以不断扩展的世界模型系统:未来往模型、数据、任务、控制信号和时间尺度中的任何一个方向继续投入,都有机会转化为更强的世界建模能力。这是 PixVerse R2 与传统“为了实时而压缩模型”的思路最本质的区别。
“言出法随”的实时世界
在用户体验层面,本次PixVerse R2 带来最重要的改变是“言出法随”。简单来说,PixVerse R2 不仅能让虚拟世界“有记忆地活着”,还能“听懂各种语言”,并对用户的每一个动作做出符合因果关系的反应。

|
构建可以实时探索互动的世界 在PixVerse R2里,一个能走进去、能探索的世界可通过文字和图像生成。同时,就像视频中那样,用户可以用WASD键控制角色移动、跳跃、四处探索,还能随时换视角;用户也能直接输入Prompt下指令——换角色、加东西、改环境,想到什么就能马上实现。过程中,角色、物体和环境间还会持续产生符合空间关系和物理逻辑的互动如自然的遮挡、接触和碰撞等。比如,在视频 25 秒处,用户对角色施加指令「Grow Wings and Fly」后,角色随即生出翅膀并悬浮于空中飞行;继续对飞行中的角色施加「Burst into Flames」指令后,角色周身冒起火光并快速降落,落地的同时身上的火光照亮并引燃了周边草地。这些变化均比较自然流畅,没有明显的拼接感或跳变。 |
|
互动影游实时交互新体验 在PixVerse R2里,世界还可以随着用户的行为产生剧情。在 PixVerse 与超级创作者“小笼包”共同开发的互动影游《零印法师》中,玩家可以利用 PixVerse R2 的实时生成与交互能力,通过 Prompt 自由输入不同指令,从而触发不同的角色反应、剧情走向和通关方式。比如,在被怪物拦路索要“礼物”时,送出“龙”或“叶子”,得到的回应完全不一样。也就是说,剧情不再是预先写好的固定分支,而是由模型根据玩家输入实时推演、动态生成。基于这种“玩家即编剧”的互动,PixVerse R2让每个人都能走出属于自己的、独一无二的故事线。 |
|
实时数字人:有身份、有记忆、有反应的剧情角色 最后,在PixVerse R2里,世界中的角色还可以实时理解并回应用户。在互动影游《畸变回声》中,超级创作者JadeWu 通过 PixVerse R2 能力搭建了实时数字人用于剧情推动。玩家可以在与关键角色 Eve 的实时交流中获取线索、推进剧情并解开谜团。Eve 会根据玩家的提问和剧情进展,给出不同的回应与引导。可以看到,PixVerse R2能够将实时角色表演、语音、人设、记忆与关系状态统一结合起来,让Eve在多轮交流中始终保持身份一致,不会“出戏”。她的回复、表情和动作会与当前上下文相互对应,随着玩家与她的关系变化而动态调整——玩家感受到的不再是一个只会念台词的NPC,而是一个真正“记得你、认识你”的剧情角色。 |
破解Scaling的关键:从“五层接力”到“两个核心引擎”
过去做实时世界模型的思路是“为了实时,不得不降低质量”。由于训练模型需经过“五层接力”,每一次接力原本的画质、动作表现、指令理解能力都会折损。同时,模型、数据、任务的规模越往上堆,这套流程就越容易散架,训练成本也水涨船高。
爱诗科技则创造性地将“能力”和“效率”解耦,先把基础模型能力上限持续扩大,然后通过独立的加速路径保持实时性,而不是在两者之间反复拉扯和让步。具体来说,其将PixVerse R2 的整个训练框架收敛成了两个核心引擎:
Omni Causal AR(全模态因果自回归)是“能力引擎”——它就像大脑,负责持续吸收更多数据、更多任务、更长的时间跨度,把世界模型的理解力和表现力训练到最强。
Real-Time Acceleration(实时加速)是“加速引擎”——负责把这套已经练到最强的能力,尽可能无损地压缩进严格的实时延迟约束里。

(图:旧式多阶段 Pipeline 与 PixVerse R2 Scaling World Modeling 对比)
两者形成一条清晰的分工和流水线:先探索能力的上限,再把这个上限变成人人都能实时打开、实时互动的产品。这背后有两个关键的设计哲学:
第一,用“分层解耦”破解“永恒妥协”。 爱诗把“能力”和“效率”变成两个各自独立、可以分别持续优化的阶段——先穷尽能力的边界,再攻克效率的边界。这是一种反直觉、也需要更大耐心的先锋设计,但换来的是未来基础模型每一次变强,都能顺着同一条流水线稳定地传递到实时产品上,而不需要每次都推倒重来。
第二,是“因果内化”。 爱诗没有让模型盲目地“逐帧硬猜下一帧会是什么”,而是先让模型理解一整段时空的完整结构,再把这种理解沿着时间的方向一步一步单向展开。这不仅让生成结果更加确定可控,也不必完全依赖“数据堆得够多、模型自己开窍”这种碰运气式的统计涌现。这对一个需要被无限期使用、随时可能被用户打断和干预的实时世界而言,是极其关键的能力。
此外,围绕上述两个引擎,PixVerse R2 在工程细节上还有大量针对性设计,让Scaling(规模化扩展)的每一步都能被实时产品稳定继承。在能力引擎一侧,Dynamic Chunk(动态)分块让文字、图像、语音、操作这些节奏不同的信号能被统一处理;多时间尺度记忆让模型同时记得“世界长什么样”和“刚刚发生了什么”;Error Bank(误差库)则专门收集模型自己跑偏的状态、反复训练纠错能力,实测中让长期画面漂移下降约35.8%,大幅改善了长序列生成的稳定性。在加速引擎一侧,教师与学生模型共用同一套因果基础,把“重新学习”变成“提速”;块稀疏注意力将计算集中在关键关联上,稀疏度超90%仍几乎不损失效果;金字塔式分阶段生成则先定结构、再补细节,用更少算力逼近离线顶级模型的效果。
亿级用户底座、系统工程基因与顶级算法的三重合力
爱诗科技自2023年创立之初就以超前判断力和工程化思维著称。公司不仅早于Sora推出首个自研视频大模型,此后旗下PixVerse V系列、C系列模型快速迭代,能力一直稳居行业第一梯队。此次PixVerse R2 领先从源头走通实时世界模型的 Scaling也再次印证了爱诗敢于做“非共识”的战略眼光。
值得注意的是,PixVerse R2 的基础模型经过全球亿级用户的长期真实使用与反馈打磨,而不只是在实验室环境中完成训练,这为后续持续 Scaling 提供了更贴近真实场景的起点,也是许多以研究为主导的团队相对欠缺的积累。
这一优势的背后,是爱诗的两种关键能力。一方面是顶级生成算法,另一方面是大规模实时系统工程,而后者恰恰是纯 AI 研究团队普遍稀缺的部分。公司创始人王长虎此前带领团队在短视频领域长期负责大规模实时系统的建设与运维,此经验被迁移到了世界模型的训练与推理架构中,构成了PixVerse R2 在实时加速环节的重要支撑。而亿级用户的持续使用,也为模型的鲁棒性训练提供了源源不断的真实交互数据。
如果说用户积累与工程基因决定了爱诗“能做什么”,那么对研发效率则决定“多快能做到”。爱诗相关负责人表示,同时推进基础研究与工程落地是一项复杂的系统工程,关键在于让每一分算力都精准投入到最需要的地方。凭借高效的资源调配与项目管理能力,爱诗成功完成了 PixVerse R2 架构的设计、训练与部署,并实现了系统的长期稳定运行。
下一代生成式世界模型的底座与基础设施
随着PixVerse R2正式发布,视频生成技术的行业格局正在发生深刻变化。

(图:R2 与异步扩散类模型、数字人实时交互类模型、传统游戏引擎的多维度技术坐标对比)
如果把今天的生成式 AI 放在更大的技术坐标系中来看,实时世界模型正处于几个不同技术方向的交叉位。传统视频生成擅长高质量内容生成但需要等待;数字人和实时交互系统能够快速回应用户,但生成的世界通常受到预设内容和交互框架限制;传统游戏引擎能够实时运行复杂世界,但世界本身主要依赖人工构建。
实时世界模型试图连接这些能力。它既需要生成模型对世界的理解和生成能力,也需要实时系统对延迟、计算和长期运行的控制能力。因此 PixVerse R2 的核心价值不只是占据一个坐标,而是改变其背后的关系,让能力和速度成为可以分别持续提升的两个维度。这一架构层面的创新为实时世界模型的发展开辟了一条可预期、可复现、可持续投入的技术路径。
目前,PixVerse R2 仍处于发展初期,存在明确的局限。在严格的实时计算和交互延迟约束下,其单次生成质量与前沿离线视频生成模型相比仍有提升空间。但其底层架构与技术路径已经过验证,具备持续迭代和演进的坚实基础。以PixVerse R2 为起点,爱诗科技将在模型、数据、任务、控制信号、时间尺度五个维度加大投入,推动R系列模型能力的持续增强。
王长虎表示,实时互动视频生成不是世界模型的全部,但它是世界模型最早能被大众感知、最接近产品化、也最容易产生新体验的一条路线。未来,实时世界模型将分阶段演进:从当前的创作工具,逐步发展为可随时进入、随时互动的生成式环境,最终成为下一代生成式世界模型的底座与基础设施。
A5创业网 版权所有