MiniMaxH3发布,2K手绘特效视频生成模型颠覆传统后期流程

MiniMax正式开源新一代视频模型H3,这款33B参数的全模态生成系统支持最高2K分辨率、15秒时长视频生成,并集成AI原生后期功能。通过端到端处理,用户仅需输入文本即可获得完整可发布的成品视频,彻...

人工智能

在人工智能视频生成领域,MiniMax近日宣布推出全新一代视频模型H3,这款开源模型凭借其强大的端到端视频生成能力,正在重新定义视频制作的未来。

与以往视频生成模型主要提供素材不同,MiniMax H3实现了从内容生成到后期处理的全流程自动化。根据官方介绍,该模型支持混合输入包括文字、图片、视频和音频在内的多模态数据,一次最多可处理9张图片、3段视频和3个音频文件,总文件上限为12个。

在实际测试中,H3展现了令人惊叹的能力。例如,在一个简单的男团出道花絮案例中,只需输入三位硅谷知名人士(Sam Altman、Dario Amodei、马斯克)的名字,模型就能自动生成包含动态视觉效果的完整视频。更令人印象深刻的是,在要求生成"苹果发布会风格"宣传片时,H3不仅准确理解了设计意图,还生成了具有玻璃质感和渐变效果的视觉元素,完全符合预期。

MiniMax H3生成的动态视觉效果

在复杂场景下,H3同样表现出色。在一个"AGI复仇者联盟"主题的六分镜预告片测试中,模型完美遵循了每个分镜的情绪方向和表演逻辑,特别是Dario Amodei崩溃捶桌子的场景,直接引发了观看者的强烈情感共鸣。

值得注意的是,H3在文字处理方面也取得了显著进步。与以往视频生成模型容易出现的文字乱码问题不同,H3能够准确渲染视频中的所有文字,包括较小和密集的文本内容。不过,测试也发现,上传图片的画质对生成结果的准确性有直接影响,清晰的截图能显著降低错误率。

作为一款开源模型,H3在性能表现上也毫不逊色。在Artificial Analysis榜单上,H3稳居视频编辑评测第一的位置,成为首个开放权重并获得社区广泛认可的SOTA(State-of-the-Art)视频模型。目前,该模型已在Hugging Face平台热度飙升至第一名,超过DeepSeek V4 Flash等竞争对手。

MiniMax H3的成功发布,标志着视频生成技术进入了一个新的阶段。它不仅降低了视频制作的技术门槛,还将大幅提升企业客户的使用成本。对于非专业视频创作者而言,这款模型提供了前所未有的便捷性,使得高质量视频内容的生产变得更加普及和高效。