MiniMax H3 正式开源!统一全模态视频生成,2K+15秒+原生立体声,一文看懂架构与玩法
2026 年 8 月 3 日MiniMax 正式开源新一代通用视频模型 MiniMax H3。这是一款面向开放通用智能的全模态生成系统统一理解文本、图像、视频、音频组成的多模态上下文直接生成最高 2K 分辨率、最长 15 秒、自带原生立体声音频的视频。本文从架构、能力、上手方式三个角度快速拆解。一、它到底是什么MiniMax H3 不是传统的文生视频模型而是一个全模态生成系统。它接收的输入可以是纯文本文生视频、一张首帧图、一张尾帧图、首尾帧组合甚至最多 9 张参考图 3 段参考视频 3 段参考音频的混合输入。输出规格同样硬核- 时长 4~15 秒- 宽高比覆盖 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16- 默认 768p配合 H3-Regenerate-2K 可生成 2K 分辨率- 24 FPS32 kHz 原生立体声音频- 稳定支持 11 种语言二、系统由三块拼成完整的 H3 系统包含三个模块1. H3-Context-IR一套托管式预处理编排系统负责把复杂的多模态输入翻译成模型更容易理解的结构化表示。由于依赖多阶段工作流和多个托管模型这部分不开源但官方提供了 API也给出了提示词指南供开发者自建。2. H3-Base真正开源的生成核心一个 33B 参数的 dense single-stream Transformer直接联合预测视频 latent 和音频 latent再分别解码成画面与立体声。3. H3-Regenerate-2K不走传统超分模块而是用 H3 基础模型对 768p 结果in-context 再生成从而复用原始上下文里的小文字、精细细节等信息。目前尚未开源官方 API 可复现完整流程。三、架构上几个亮点- 统一编码文本用 H3-Encoder基于 Qwen3-VL-32B 预训练权重、视觉用 H3-Encoder H3-VisualVAEf16t4d24空间压缩 16 倍、时间压缩 4 倍、音频用 H3-AudioVAE32kHz 压到 40Hz latent全部拼成一个 packed multimodal sequence 喂给 Transformer。- 三维位置编码使用 MM-RoPE 表达 (t, h, w) 时间与空间位置关系没有 modality-specific 的 attention/FFN 结构模态差异只体现在 input/output 层和 AdaLN 分支这让模型更简洁、可扩展。- 原生稀疏注意力训练末期引入能显著降低长序列计算开销首版开源仅提供全注意力推理稀疏版本后续更新发布。四、怎么上手H3-Base 以 task-specific checkpoint 形式发布FL2VA 与 Ref2VA每个都是 self-contained 的 Hugging Face 模型仓库含 processor、tokenizer、text encoder、Omni Transformer、Visual VAE、Audio VAE。支持 SGLang、vLLM、diffusers、ComfyUI 等主流推理框架官方还提供了 T2VA / FL2VA / Ref2VA 三类可复现的 768p 音视频生成案例。五、一个不得不说的趋势MiniMax H3 的发布标志着视频生成正从文生视频走向全模态生成。而且它背后体现的以任务泛化为导向的设计哲学恰好和 AI 编程领域的新一代 Agent 思路殊途同归——把复杂的真实需求交给一个能统一理解上下文的系统去完成而不是让它死板地执行单一指令。