2026 年 8 月 3 日,MiniMax 宣布正式开源新一代通用多模态生成模型 MiniMax H3。这是 MiniMax 推出的首款开源多模态生成模型,也是开源领域首个真正意义上的「全模态」统一模型。在权威评测平台 Artificial Analysis 榜单中,H3 视频编辑能力排名第一,性能直逼闭源最强旗舰。
一、发布背景
长期以来,视频生成领域由闭源模型主导,迭代速度缓慢,生态系统开放程度远不及大语言模型等领域。2026 年 7 月 31 日,MiniMax 正式发布 H3 并宣布即将开源;仅三天后的 8 月 3 日,模型权重如约开放,开发者可直接从 Hugging Face 下载。
MiniMax 将 H3 定义为从「特化任务模型」向「通用多模态智能」的关键跨越。H3 不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。
二、技术架构
2.1 三段式系统架构
完整的 H3 系统由三个模块串联组成,覆盖理解、生成、超分全流程:
模块 | 功能定位 | 说明 |
H3-Context-IR | 理解模块 | 解析自由格式的多模态输入(文字、图片、音频、参考视频),理清与目标视频的关系,输出结构化指令 |
H3-Base | 生成模块 | 基于结构化指令,生成 768p 基础视频 |
H3-Regenerate-2K | 超分模块 | 将 768p 视频重生成至 2K 分辨率 |
2.2 四项核心技术创新
1. Contextual Omni Representation(上下文全向表示):用语言统一所有任务的中间层表示,早期即去除任务、能力、模态之间的「隔离墙」。
2. H3-VAE:高效的多模态变分自编码器,支撑统一的生成压缩与重建。
3. H3-Omni Transformer:统一 Transformer 架构,处理文本、图像、视频、音频的联合建模。
4. In-context Regeneration(上下文内重现):在生成过程中根据上下文动态调整,实现更高质量的内容重生成。
此外,H3 还借鉴了文本模型发展中已验证的方法,包括复杂问题拆解(Reasoning)、Scaling Context 和 Muon 优化器,将其应用于多模态理解、数据构建和模型训练。
三、核心能力
3.1 统一多模态理解与生成
用户可以同时上传文字、图片、音频、视频等多种输入,一个模型完成理解后直接生成缺失的模态。例如上传一段动画参考视频和一张街景图片,H3 会识别球状屏幕的几何特性并让人物运动遵循球面变形规律,同时自动补齐原生双声道音频。
3.2 输出规格
规格维度 | 指标 | 说明 |
分辨率 | 最高 2K 直出 | 默认提供 2K,无需后处理超分 |
时长 | 最长 15 秒 | 支持生成短视频片段 |
音频 | 原生立体声 | 告别无声哑巴片,同步生成双声道音效 |
3.3 商业场景适用性
在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,适用于以下领域:
· 广告与品牌推广
· 电子商务(商品展示视频)
· 产品设计与 UI/UX
· 游戏与娱乐内容创作
· 短视频内容批量生成
3.4 性价比优势
2K 分辨率下:
H3 每秒价格不到主流机型的三分之一
768p 分辨率下:
价格不到主流机型 720p 的一半
四、开源生态:16 家芯片厂商同日完成适配
H3 开源首日,生态适配规模空前。截至发布当天,以下芯片厂商、开发社区与云推理平台均已完成适配支持:
芯片厂商(16+)
华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel 等国内外主流 AI 芯片厂商
开发社区与平台
Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub
推理框架支持
SGLang、vLLM、diffusers、ComfyUI
五、意义与影响
5. 任务壁垒被打破:过去文生图、图生视频、音效生成、视频编辑各自为政的格局被统一的全模态模型取代。
6. 开源社区获得新选择:终于有了一个能力逼近闭源旗舰的开源全模态模型,开发者可自由定制和部署。
7. 硬件生态加速融合:16+ 芯片厂商同日适配,展示了国产 AI 硬件生态的高效协作,也为未来端侧部署铺平道路。
业界评价:这可能是和 DeepSeek R1 开源同样重要的时刻——开源领域终于有了一个真正意义上的通用多模态智能体。
维核科技,清华技术团队全程托管,大模型私有化部署、大模型训练、模型微调、搭建企业知识库,一站式搞定。
