MiniMax H3

MiniMax H3

稀宇科技2026年7月31日发布的通用全模态生成模型,支持文本/图像/视频/音频统一理解与生成,2K分辨率原生双声道输出,8月3日开源。

月访问量
0
累计浏览
1
用户评分
4.3
收录时间
2026-08

产品介绍

产品介绍

MiniMax H3 是稀宇科技(MiniMax)于2026年7月31日发布的通用全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,能够输出具备原生双声道的音视频内容,最高支持 15 秒 2K 分辨率视频生成。H3 从特化任务模型迈向通用多模态智能,计划于8月3日开源模型权重,是国产多模态大模型的重要里程碑。

核心功能

  • 全模态统一理解:支持文本、图片、音频、视频任意组合输入,自然语言描述复杂参考关系
  • 2K 分辨率原生输出:无需超分模块,通过 In-context Regeneration 技术实现高分辨率生成
  • 原生双声道音频:视频生成自带立体声音频,支持人声、音效、音乐联合建模
  • V2V Motion Transfer:视频到视频动作迁移,精准控制角色动作与场景
  • 多镜头原生建模:支持复杂镜头语言和多镜头叙事
  • 极致性价比:2K 分辨率下每秒价格不到主流模型的 1/3
  • 国产芯片适配:设计初期即考虑多款国产芯片兼容性

技术亮点

  • Contextual Omni Representation:定制化全模态理解管线,100K Token 推理生成 4K Token 描述
  • H3-VAE:革新 tokenizer 技术,4 倍序列长度收益,大幅降低训练推理成本
  • H3-Omni Transformer:理解与生成异构训练架构,端到端训练吞吐提升近 30%
  • In-context Regeneration:基模自再生超分方案,超越传统超分的细节还原能力

典型使用场景

  • 广告与电商视频生成
  • 电影片头与动态海报
  • 游戏 UI 与动画制作
  • 品牌营销内容创作
  • 产品设计与 UI/UX 原型
  • 多模态内容编辑与二次创作

平台支持

通过海螺 AI(Hailuo AI)官网和 MiniMax API 平台访问使用,模型权重计划于 2026 年 8 月 3 日在魔搭社区开放下载。