MiniMax H3 logo

MiniMax H3

打开

MiniMax 于 2026 年 7 月 31 日发布的开源向多模态视频模型:文/图/视频/音频输入,768P 或 2K 输出,4–15 秒,原生立体声,按秒计费。

分享:

MiniMax H3

MiniMax H3 是 MiniMax 的通用多模态生成模型,2026 年 7 月 31 日发布。研究博文写它能统一理解文本、图像、视频和音频,并生成最长 15 秒、最高 2K、带原生立体声的视频。API 文档里的模型名是 MiniMax-H3,支持文生视频、首尾帧图生视频,以及用图像、视频片段和音频做参考生成。消费端试玩走 Hailuo。MiniMax 说计划在符合法规的前提下开放权重。在确认当前权重包之前,不要默认已经能本地下载。

核心功能

  • 统一多模态上下文:官方例子是从视频 1 取运镜、从图像 2 取角色、从音频 3 取人声,再用文字描述它们的关系。
  • 输出规格:768P 或 2K,时长 4–15 秒(仅整数),模型表为 24 fps,常见或自适应画幅。
  • 参考上限:最多 9 张图;最多 3 段视频,每段 2–15 秒,视频输入总计不超过 15 秒;宽高在 256–5760。
  • 面向生产的卖点:MiniMax 强调指令遵循、文字与品牌呈现,以及视频到视频的运动迁移,适合广告、电商、UI 和游戏。
  • 开源权重意向:7 月 31 日的文章写“未来几天开放权重”。做离线部署前再核博客和 GitHub。

适用场景

  • 必须看清 logo 或包装的品牌与商品视频
  • 已有静帧、运镜和声轨时的参考驱动镜头
  • 先用 768P 打样,再用再生端点出 2K

定价

H3 不在 MiniMax 视频点数包里。官方按量计费(查阅于 2026-08-17):

输出 标价
2K $0.13 / 秒
768P $0.08 / 秒

输入音频免费。前 5 张图免费,之后每张 $0.04。输入视频按对应分辨率的每秒价格计。把 768P 结果再生为 2K,按新输出每秒 $0.05,且原输入素材会再计一次。发布文称 2K 每秒价格不到主流模型的三分之一;报价请用上表,把这句话当厂商文案。

快速开始

  1. H3 博文,只想试玩就走 Hailuo。
  2. API 请用 按量视频指南 和 v2 创建端点,不要买 Hailuo 2.3 的点数包指望跑 H3。
  3. 找提示词时用 768P,再再生到 2K。
  4. 需要权重就先确认真的已经放出。7 月那篇是计划,不是下载链接。

常见问题

这是换了名字的 Hailuo 02 吗?

不是。Hailuo 2.3 仍在旧视频表上(1080p/768p,6–10 秒)。H3 是下一代多模态模型,有 2K 和 4–15 秒。

能用视频点数买 H3 吗?

还不能。点数包页面写明暂不支持 H3。用按量或定制销售方案。

和 FLUX 3 比呢?

FLUX 3 是 Black Forest Labs 的多模态生成器,单段最长 20 秒。H3 是 MiniMax 的 2K 立体声路线,并承诺开源权重。

替代方案

  • FLUX 3:BFL 的先草稿再精渲视频与音频。
  • Veo 3:已经在 Gemini 体系里时的 Google 视频。
  • MiniMax:Code、Speech、Music 与 H3 并列的公司入口。

使用技巧

  1. 在提示词里写清参考之间的关系。模型是来绑定这些输入的,不是来猜的。
  2. 把输入视频控制在 15 秒预算内。多出来的片段不符合已公布限额。
  3. 投放前再核按量价。点数 SKU 仍在描述 Hailuo,不是 H3。

总结

2026 年下半年若你需要多模态参考和 2K 立体声短片,应评估 H3。从 Hailuo 或按量 API 起步,再确认开源权重是否真的落地。第一方起点是 H3 研究博文

评论

还没有评论。成为第一个评论的人!