114B参数、6B激活!Sand.ai开源全球首个千亿MoE视频生成模型MAGI-2-preview
近日,由清华系团队Sand.ai开发的全球首个基于MoE(专家混合模型)架构的千亿参数视频生成模型MAGI-2-preview正式开源。这一突破性成果不仅刷新了视频生成模型的参数规模上限,更通过创新的...
近日,由清华系团队Sand.ai开发的全球首个基于MoE(专家混合模型)架构的千亿参数视频生成模型MAGI-2-preview正式开源。这一突破性成果不仅刷新了视频生成模型的参数规模上限,更通过创新的计算架构解决了视频生成领域长期面临的「不可能三角」难题:模型要更大、视频要更长、成本还要可承受。
MAGI-2-preview的核心参数配置为总参数114B,单次前向计算时仅激活约6B参数。这意味着在保持超大规模模型容量的同时,显著降低了实际运行成本。以当前8卡H100显卡的市场行情计算,生成一段10秒1080P分辨率的视频,其成本仅需5毛钱,相比行业主流模型降低了约90%。
从性能表现来看,MAGI-2-preview在AA视频生成榜单上排名第六,仅用6B激活参数就达到了接近第一梯队的效果。无论是AI漫剧的声台形表四角俱全,还是酣畅淋漓的长镜头运镜,亦或是商业场景中的专业级表现,该模型都能轻松应对,展现出与闭源顶级模型同台PK的实力。
这一成果的实现,得益于Sand.ai团队对视频生成模型Scaling路线的深入思考。与文本模型不同,视频模型需要处理动态世界中的大量空间patch和连续帧信息,叠加文本、音频等多模态数据后,序列长度会呈指数级增长。传统的稠密模型在面对这种超长序列时,训推成本几乎无法承受。
为此,Sand.ai团队选择了MoE架构作为解决方案。通过将模型容量与单次计算部分解耦,MAGI-2-preview能够在保持百亿千亿级总容量的同时,每次推理只激活其中一小部分,从而有效控制成本。然而,视频MoE也带来了新的挑战,包括通信开销、训练稳定性和跨模态协作等问题。Sand.ai团队通过重构底层系统,成功解决了这些难题,实现了视频MoE从理论到实践的跨越。
MAGI-2-preview的开源,不仅为视频生成领域注入了新的活力,也为整个AI行业提供了重要的参考。随着更多开发者加入,预计未来视频生成技术将迎来新一轮的爆发式发展。