视频模型新赛段:MiniMax开源H3对决字节Seedance 2.5,2K音视频直出冲击商用门槛
视频模型新赛段:MiniMax开源H3对决字节Seedance 2.5,2K音视频直出冲击商用门槛
7月31日MiniMax与字节跳动同日发布新一代视频模型:H3支持15秒2K带双声道视频并承诺数日内开源权重,Seedance 2.5单次生成30秒并强化局部编辑。开源旗舰与闭源工业化路线正面交锋,视频生成进入生产可用时代。
7月31日,AI视频生成领域迎来标志性的"撞车日"——MiniMax正式发布全模态视频生成模型H3,字节跳动同日推出Seedance 2.5,两款旗舰级产品在同一天上线,标志着视频模型竞争进入全新阶段。
MiniMax H3:首个商用级开源多模态视频基座
H3是MiniMax迄今最重磅的视频模型,核心能力包括:
- 全模态统一理解:可同时接收文本、图片(最多9张)、视频(最多3段)、音频(最多3段)混合输入,素材总数不超过12份
- 2K双声道输出:最长15秒,原生输出带双声道音频的2K分辨率视频
- 精准编辑能力:整合人物替换、背景更换、动作迁移,支持局部调整服装、声音或镜头节奏,核心解决行业痛点"改一处毁整段"
- 音画协同:支持音色克隆、音画同步,直接输出可用作后期素材的片段
- 即将开源:承诺数日内开放模型权重,ComfyUI核心开发者已提前拿到权重并确认将提供首日支持
在Artificial Analysis盲选投票榜单中,H3以1242分位列有声文生视频第二,视频编辑榜单以1130分排名第一。2K视频生成成本约0.8元/秒,不到主流产品的三分之一。
字节Seedance 2.5:闭源工业化路线纵深推进
字节选择了完全不同的路径,沿闭源工业化方向继续深耕:
- 30秒原生直出:打破行业10-15秒的时长天花板,支持更长叙事
- 50个全模态参考输入:大幅提升素材参考能力
- Anti-Gacha局部精准编辑:减少"抽卡"次数,降低综合生成成本
- 480P/720P双档输出:满足不同场景需求
- 生态闭环:将迅速接入即梦AI、剪映、豆包专业版,通过火山方舟提供API服务
开源vs闭源:两条路线的终极博弈
这次同日发布折射出AI视频领域两种截然不同的竞争哲学:
- 字节纵向一体化:模型即梦/剪映制作→抖音/TikTok分发→巨量引擎变现,保持闭源可最大化内部协同
- MiniMax横向开放:以开放权重换取云厂商、工具平台、企业客户的广泛分发,争取成为行业通用技术底座
ComfyUI团队确认H3可在RTX 3060上运行(速度较慢),且拿到的是与API一致的非缩水版权重。若第三方能稳定复现其画质与成本优势,视频模型供应方将从单一厂商扩展为云平台、推理服务商和本地部署团队,真正改变产业分工格局。
视频生成的下一程,已从"谁的镜头更长、画面更好"转向"谁能进入更多生产流程并长期留下来"。