稀宇科技发布新一代 多模态生成视频模型 走向“商业级生产”



(上海31日综合电)上海通用人工智能科技公司稀宇科技(MiniMax)今天发布新一代多模态生成视频模型MiniMax H3,是开放通用的多模态视频模型,并将于近期开源。
MiniMax H3可支援文本、图片、音讯和视频多种输入形式,支持2K解析度直出,可生成最长15秒的音画内容。根据Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名全球第一。
ADVERTISEMENT
在模型效果方面,MiniMax H3具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)方面表现出色,可实现精准、可控的多模态内容编辑与生成,并广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。
自成立以来,MiniMax坚持文本与多模态模型并行自研,已先后开源三代M系列文本模型。H3是MiniMax推出的首款开源多模态生成模型。
H3借鉴了文本模型发展过程中已经被验证的方法,包括复杂问题拆解、Reasoning、Scaling Context和Muon优化器,并将应用到多模态理解、数据构建和模型训练中。围绕不同任务的理解和指令遵循,MiniMax对数据体系进行了多轮迭代,提升模型面对开放输入和复杂指令时的泛化能力。
MiniMax H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。MiniMax通过高压缩Tokenizer降低视频生成所需的Token数量,实现了成本优化与效率的提升。针对视频长度、分辨率和多模态理解与生成负载差异较大的特点,MiniMax在异构训练、负载均衡和GPU利用效率方面进行系统优化,在追求模型效果的同时控制训练和推理成本。
MiniMax H3将业内多模态模型的竞争进一步带向效果、成本、开放性与生态协同的综合维度,丰富了模型企业与国产AI芯片软硬件协同生态。
与此同时,MiniMax多模态路线进入了模型能力、训练效率、开源生态和行业应用协同推进的新阶段。
ADVERTISEMENT
热门新闻
百格视频
ADVERTISEMENT


