月访问量
0
累计浏览
1
用户评分
4.3
收录时间
2026-08
产品介绍
产品介绍
MiniMax H3 是稀宇科技(MiniMax)于2026年7月31日发布的通用全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,能够输出具备原生双声道的音视频内容,最高支持 15 秒 2K 分辨率视频生成。H3 从特化任务模型迈向通用多模态智能,计划于8月3日开源模型权重,是国产多模态大模型的重要里程碑。
核心功能
- 全模态统一理解:支持文本、图片、音频、视频任意组合输入,自然语言描述复杂参考关系
- 2K 分辨率原生输出:无需超分模块,通过 In-context Regeneration 技术实现高分辨率生成
- 原生双声道音频:视频生成自带立体声音频,支持人声、音效、音乐联合建模
- V2V Motion Transfer:视频到视频动作迁移,精准控制角色动作与场景
- 多镜头原生建模:支持复杂镜头语言和多镜头叙事
- 极致性价比:2K 分辨率下每秒价格不到主流模型的 1/3
- 国产芯片适配:设计初期即考虑多款国产芯片兼容性
技术亮点
- Contextual Omni Representation:定制化全模态理解管线,100K Token 推理生成 4K Token 描述
- H3-VAE:革新 tokenizer 技术,4 倍序列长度收益,大幅降低训练推理成本
- H3-Omni Transformer:理解与生成异构训练架构,端到端训练吞吐提升近 30%
- In-context Regeneration:基模自再生超分方案,超越传统超分的细节还原能力
典型使用场景
- 广告与电商视频生成
- 电影片头与动态海报
- 游戏 UI 与动画制作
- 品牌营销内容创作
- 产品设计与 UI/UX 原型
- 多模态内容编辑与二次创作
平台支持
通过海螺 AI(Hailuo AI)官网和 MiniMax API 平台访问使用,模型权重计划于 2026 年 8 月 3 日在魔搭社区开放下载。