AI AI工具情报站
国内AI动态 ai-models

开源全能多模态生成模型,支持 2K 原生立体声视频

📰 MiniMax:Blog(网页) 📅 2026-07-31

核心亮点

MiniMax 正式发布全能多模态生成模型 H3,主打一件事:打破任务与模态之间的边界。H3 能联合理解文本、图像、视频和音频,并生成最高 2K 分辨率、15 秒时长、带原生立体声的视频。"原生"是这里的关键词——声音不是后期配上去的,而是和画面在同一个生成过程中一并产出,做到声画同源。价格上,2K 每秒成本低于主流模型的三分之一,768p 低于主流 720p 价格的一半。官方还宣布计划近日开源模型权重、免费提供使用。

具体能力

H3 的定位是"全能"而不是"文生视频"。它把理解与生成收进同一套架构,输入可以是任意模态的组合:一段文字配一张参考图,或者一段视频配一段音频描述。输出侧同样覆盖多类任务——文生视频、图生视频、视频到视频的动作迁移(V2V)。

官方强调的三个强项是指令跟随、文字与品牌呈现、V2V 动作迁移。指令跟随说的是复杂提示词里的多个约束能被同时满足,不会顾此失彼——加了镜头运动就丢了服装细节,是当前视频模型的常见毛病。文字与品牌呈现是行业公认的痛点:画面里的汉字容易糊成乱码,logo 容易变形错位,而这恰恰是广告和电商素材能不能直接用的硬门槛。V2V 动作迁移则是把源视频的动作骨架套到新角色或新场景上,属于二创和批量生产的效率工具。

技术细节

原生立体声要求模型在时间轴上对齐视觉事件与声音事件:脚步落地、物体碰撞、门的开合、环境混响,都要和画面同步,还要在左右声道上体现出空间位置感。这比"先生成视频再配音"难得多,需要联合建模而不是串联两个独立模型,训练数据也必须是声画对齐的原始素材而非拼接产物。

2K 分辨率下的成本控制同样关键。视频生成的计算量大致随分辨率平方增长,能把 2K 每秒价格压到主流三分之一以下,说明在架构或推理调度上做了实质优化,比较可能的方向是更高效的时空压缩表示、蒸馏后的少步采样,以及针对长序列的注意力改造。15 秒时长站在当前主流 5 到 10 秒之上,长时序里的主体一致性、光影连贯性是另一重考验。

与竞品对比

Sora、Veo、可灵、海螺构成当下第一梯队。Veo 3 已经支持带音频生成,Sora 2 也在跟进,H3 的差异化在于把 2K、原生立体声、开源计划这三件事凑在了一起。闭源模型再强,社区也无法在其上做微调和二次开发,能力边界完全由厂商定义;开源权重意味着开发者可以本地部署、训 LoRA、按自己的业务做垂直适配。对国产 GPU 厂商,一个权重可获取的强多模态模型是难得的适配靶子,能直接推动算子覆盖和推理框架成熟。

行业影响

最直接的受益方是广告、电商和短视频内容生产。2K 加立体声的组合已经逼近可直接投放的素材标准,价格降到三分之一意味着批量试错的成本大幅下降——一条素材不满意,可以生成二十条挑一条,创意流程从"精雕细琢一次成功"变成"大量筛选"。V2V 能力对 IP 二创和虚拟形象运营是效率倍增器,一套动作可以驱动整个形象矩阵。

开源如果如期落地,会给国内多模态生态提供一个新的基座选择。当前视频生成领域的开源可用模型在分辨率、时长和音频能力上普遍落后闭源一代以上,一个接近前沿的权重放出来,学术界能做可复现的评测,创业公司能在其上做行业垂类,硬件厂商能拿它做性能标定,整条链路的迭代速度都会被抬起来。