PixVerseR2攻克实时世界模型Scaling难题,开启生成式AI新纪元
爱诗科技推出的PixVerse R2实时世界模型,通过五维扩展框架成功解决“快”与“强”的矛盾,实现持续运行的动态世界。该产品让用户真正进入一个可交互、可控制的虚拟环境,标志着生成式AI从静态内容向动...
在人工智能领域,大语言模型(LLM)通过Scaling定律实现了能力的持续提升,但将这一经验迁移到实时世界模型时却面临巨大挑战。2026年1月,爱诗科技提出"通用实时世界模型"概念并推出R1,如今其升级版PixVerse R2已全量上线,为用户带来全新的实时交互体验。
PixVerse R2的核心突破在于其独特的五维扩展框架,将模型、数据、任务、控制信号和时间尺度五个维度纳入同一可扩展路径。这种设计使得生成质量、长程一致性和多模态控制能够共同提升,解决了传统实时世界模型中"快"与"强"互相拉扯的难题。例如,在"模型"维度上,参数更多意味着理解力更强;在"数据"维度上,见过的世界更多则能实现更好的泛化效果。
与传统的AI视频不同,PixVerse R2采用了一种全新的运行机制。以"冬日宫殿"场景为例,用户可以通过WASD键控制移动与视角,新的指令可以继续改变当前体验。技术报告显示,整个会话过程中客户端仅观察到一次session_init和generation_started,后续八轮系统推荐Prompt共享同一条内容流,提示历史从第一轮连续累积到第八轮。这意味着,八轮Prompt并不是八个独立的视频任务拼凑而成,而是当前世界下一步如何变化的连续控制输入。
为了验证这一技术的实际效果,研究人员对"冬日宫殿"会话的HAR网络记录进行了分析。数据显示,在约119.5秒的生成窗口里,所有操作都被组织在同一条持续session中。客户端没有为每一轮输入重新预约资源、初始化会话或切换媒体通道,而是通过高频、低层控制流持续发送动作帧。这些动作帧的发送间隔中位数约为29.944毫秒,折算频率约33.4Hz,确保了用户操作的实时响应。
PixVerse R2的出现不仅改变了用户与AI的交互方式,也为实时世界模型的产品化开辟了新的路径。正如早期访问者所描述的那样:"走着走着怪兽就冒出来了",这正是实时生成世界的魅力所在。未来,随着技术的进一步发展,我们或许能看到更多令人惊叹的应用场景,如完全沉浸式的虚拟现实体验、个性化的历史重演,甚至是基于实时世界模型的智能城市模拟。
此外,PixVerse R2还展示了其在多模态控制方面的强大能力。在"Lone Moon"场景中,用户不仅可以探索世界,还能通过实时交互改变环境。这种能力的背后,是PixVerse R2对Prompt和Action的深度融合,使得用户与模型的关系从简单的请求-响应模式转变为深度交互模式。
尽管PixVerse R2已经取得了显著的技术突破,但其发展仍面临一些挑战。例如,如何进一步优化计算效率以支持更大规模的实时世界,以及如何在保证实时性的同时提升模型的泛化能力等。这些问题的解决,将决定PixVerse R2能否真正成为下一代生成式AI的标杆产品。
