MiniMax H3
MiniMax H3 是 MiniMax 的通用多模态生成模型,2026 年 7 月 31 日发布。研究博文写它能统一理解文本、图像、视频和音频,并生成最长 15 秒、最高 2K、带原生立体声的视频。API 文档里的模型名是 MiniMax-H3,支持文生视频、首尾帧图生视频,以及用图像、视频片段和音频做参考生成。消费端试玩走 Hailuo。MiniMax 说计划在符合法规的前提下开放权重。在确认当前权重包之前,不要默认已经能本地下载。
核心功能
- 统一多模态上下文:官方例子是从视频 1 取运镜、从图像 2 取角色、从音频 3 取人声,再用文字描述它们的关系。
- 输出规格:768P 或 2K,时长 4–15 秒(仅整数),模型表为 24 fps,常见或自适应画幅。
- 参考上限:最多 9 张图;最多 3 段视频,每段 2–15 秒,视频输入总计不超过 15 秒;宽高在 256–5760。
- 面向生产的卖点:MiniMax 强调指令遵循、文字与品牌呈现,以及视频到视频的运动迁移,适合广告、电商、UI 和游戏。
- 开源权重意向:7 月 31 日的文章写“未来几天开放权重”。做离线部署前核对博客和 GitHub。
适用场景
- 必须看清 logo 或包装的品牌与商品视频。
- 已有静帧、运镜和声轨时的参考驱动镜头。
- 先用 768P 打样,再用再生端点出 2K。
定价
H3 不在 MiniMax 视频点数包里。官方按量计费(查阅于 2026-08-17):
| 输出 | 标价 |
|---|---|
| 2K | $0.13 / 秒 |
| 768P | $0.08 / 秒 |
输入音频免费。前 5 张图免费,之后每张 $0.04。输入视频按对应分辨率的每秒价格计。把 768P 结果再生为 2K,按新输出每秒 $0.05,且原输入素材会再计一次。发布文称 2K 每秒价格不到主流模型的三分之一;报价请用上表,把这句话当厂商文案。
快速开始
- 读 H3 博文,只想试玩就走 Hailuo。
- API 请用 按量视频指南 和 v2 创建端点,不要买 Hailuo 2.3 的点数包指望跑 H3。
- 找提示词时用 768P,再再生到 2K。
- 需要权重就先确认真的已经放出。7 月那篇是计划,不是下载链接。
常见问题
这是换了名字的 Hailuo 02 吗?
不是。Hailuo 2.3 仍在旧视频表上(1080p/768p,6–10 秒)。H3 是下一代多模态模型,有 2K 和 4–15 秒。
能用视频点数买 H3 吗?
还不能。点数包页面写明暂不支持 H3。用按量或定制销售方案。
和 FLUX 3 比呢?
FLUX 3 是 Black Forest Labs 的多模态生成器,单段最长 20 秒。H3 是 MiniMax 的 2K 立体声路线,并承诺开源权重。
替代方案
使用技巧
- 在提示词里写清参考之间的关系。模型是来绑定这些输入的,不是来猜的。
- 把输入视频控制在 15 秒预算内。多出来的片段不符合已公布限额。
- 投放前核对按量价。点数 SKU 仍在描述 Hailuo,不是 H3。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。