Newsroom
AIEII

MiniMax H3怎么用,视频生成本地部署与API教程

MiniMax H3是2026年7月底发布的开源多模态视频模型,能出15秒2K视频带立体声。这篇讲清楚API怎么调、本地部署要多少显存、和主流视频模型比价格差多少。

TL;DR
  • MiniMax H3是2026年7月31日上线的多模态视频模型,能吃文字、图片、视频、音频四种输入,直出最长15秒的2K视频,自带立体声,API价格0.13美元/秒。
  • 模型权重8月初开源,官方给出的确切参数是330亿(33B),不是坊间流传的1380亿;本地跑最低门槛是12GB以上显存加约64GB内存,走动态卸载。
  • 开源协议是MiniMax自家的Community License,免费商用,但欧盟、英国、韩国、美国这四个地区被明确排除在授权范围外。
MiniMax H3怎么用,视频生成本地部署与API教程

MiniMax H3是MiniMax在2026年7月31日上线的视频生成模型,卖点是"一个模型吃四种输入":文字、图片、视频、音频都能喂进去,直接吐出最长15秒、2K分辨率、自带立体声的视频。8月初权重开源到Hugging Face,个人和企业都能免费拉下来本地跑,但有四个地区被排除在商用授权外。

这篇教程分两条路:想用API的,跳到第二节直接调;想本地部署的,看第三节的硬件门槛,别一上来就冲着1380亿参数的传言去配机器,官方确认的实际数字是330亿。


MiniMax H3是什么

先把参数搞对。网上不少文章说H3是1380亿参数,但根据MiniMax官方博客和社区对Hugging Face权重的拆解,H3的核心模块H3-Omni Transformer是330亿参数的密集Transformer,50层,隐藏维度5376,56个注意力头,其中约130亿参数落在AdaLN相关分支里,推理时可以预计算缓存,不用全部加载。1380亿这个数字更可能是把MiniMax同期规划开源的语言模型M3 Pro(对外说的是2.7万亿参数)张冠李戴了,两者是完全不同的模型。

MiniMax给H3列的核心能力:

项目规格
输入模态文本 / 图片 / 视频 / 音频
输出分辨率最高2K,也支持768p
视频时长4到15秒
帧率最高24fps
音频原生立体声,和画面同一遍生成
宽高比21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16

官方博客提到两项工程改进:H3-VAE分词器带来"4倍有效序列长度"提升,架构调整让训练吞吐量提高了近30%。没有公开的量化benchmark分数,这两个数字是MiniMax自己给的相对提升,没有第三方跑分交叉验证,看看就好。

用API生成第一条视频

不想折腾本地环境,直接调API是最快的路子。MiniMax开放平台和OpenRouter都能调,价格一致:2K分辨率0.13美元/秒,参考图片前5张免费之后0.04美元一张,参考音频不额外收费。15秒的2K视频算下来接近2美元一条。

以OpenRouter为例(省去自己对接MiniMax账号体系的麻烦):

curl https://openrouter.ai/api/v1/videos \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax/hailuo-3",
    "prompt": "一只猫在雨后的东京街头跳过积水,慢镜头,电影质感",
    "duration": 8,
    "resolution": "2k",
    "aspect_ratio": "16:9"
  }'

几个实操要点:

  • 时长和分辨率组合影响价格,8秒2K比15秒2K便宜将近一半,先用短时长跑通prompt再加时长。
  • 768p目前还在部分平台的内测阶段,不是所有渠道都开放,价格约0.09美元/秒,想省钱先去对应平台文档确认是否已上线。
  • 输入端支持参考图和参考音频,想让人物形象或声音保持一致,把参考素材传进去比纯文字prompt稳。
  • MiniMax在官方平台是唯一托管方,OpenRouter只是转发请求不做路由决策,出问题优先查MiniMax那边的服务状态。

本地部署的硬件门槛

权重是8月初以MiniMaxAI/MiniMax-H3的名字挂到Hugging Face的,社区很快跟进了ComfyUI的GGUF量化版本。想省钱本地跑,先看清楚三档量化的体积:

量化方案体积(不含VAE)说明
bf16(全精度)约66.28GB效果最好,普通显卡吃不下
int834.04GB(未剪枝)/ 27.14GB(文本编码器)精度损失可控
nvfp4 AWQ15.69GB(文本编码器)配合剪枝checkpoint能把总体积压到42.5GB

最省显存的组合是剪枝后的fl2va checkpoint(20.97GB)加nvfp4 AWQ文本编码器(15.69GB)再加两个VAE(合计5.82GB),加起来42.5GB。ComfyUI团队给出的说法是12GB以上显存的显卡配合动态卸载能跑起来,但代价是要拿系统内存换显存,实测建议再备约64GB系统内存。而且原生只能出768像素短边的视频,2K效果得靠二次重生成(regeneration)流程补上去,不是一步到位。

也就是说,家用级显卡(比如12GB到16GB显存那一档)能跑,但跑的是打折版体验:分辨率降级、生成变慢、内存占用高。真要图省心出2K成片,现阶段API比本地部署划算,除非你有专门跑视频模型的工作站或云GPU。

开源协议要看清楚

权重免费商用,但MiniMax H3的Community License明确排除了欧盟、英国、韩国、美国这四个地区的授权范围,治理法律是中国香港特别行政区法律。中国大陆、东南亚、日本等地区不在排除名单里,可以正常下载和商用部署。文本编码器部分是单独打包的,用的是限制更宽松的Apache 2.0协议。

如果你的产品要面向被排除的四个地区的用户提供服务,本地部署这条路基本走不通,得回到MiniMax官方API这条合规路径,或者等官方后续更新协议条款。

我的判断

MiniMax H3对个人开发者最大的价值不是本地部署,是API这条路。0.13美元/秒的2K视频加原生立体声,放在同类模型里价格不算贵,适合拿来做产品demo、短视频素材测试这类不追求批量产出的场景。本地部署门槛看着是12GB显存,但那是打折体验(768p+慢速卸载),真要出2K还得二次重生成,对个人用户不划算,除非你本来就有闲置的工作站GPU。至于1380亿参数这个说法,建议看到就打个问号,官方和社区拆解都指向330亿,数字对不上的时候先查权重本身而不是信通稿。

相关阅读

参考

常见问题

MiniMax H3到底是多少参数?
官方技术博客没有直接给参数量,但开源到Hugging Face的H3-Omni Transformer经社区拆解确认是330亿参数的密集(非MoE)单流Transformer,50层,隐藏维度5376。网上流传的1380亿参数说法没有官方或社区来源支撑,很可能是把MiniMax同期的M3 Pro语言模型(对外宣称2.7万亿参数规划开源)和H3搞混了,两者不是一回事。
本地部署MiniMax H3需要什么硬件?
官方没有公布硬件基线,社区实测的最低配置是12GB以上显存的显卡,配合约64GB系统内存做动态卸载,原生只能生成768像素短边的视频,2K效果要靠二次重生成(regeneration)流程补上去。完整精度权重(bf16)要66GB左右,量化到nvfp4或int8能压到42.5GB到63GB不等,普通消费级显卡吃起来还是吃力。
API调用一段视频大概多少钱?
MiniMax官方和OpenRouter给的价格一致,2K分辨率是0.13美元/秒,算下来15秒的视频接近2美元。768p分辨率在部分平台还在内测阶段,价格约0.09美元/秒。参考图片前5张免费,之后0.04美元一张,参考音频不额外收费。
中国用户能不能用开源权重本地部署?
能。MiniMax H3的Community License明确排除的是欧盟、英国、韩国、美国这四个地区的商用授权,中国大陆用户不在排除名单里,可以正常下载权重做研究和商用部署。文本编码器部分单独用的是Apache 2.0协议,限制更少。
广告合作联系
立即联系 →
加入会员申请
了解详情 →
← AI 周刊 #29:OpenAI 暂停 … Qwen3.8-Max 和 DeepSeek … →
💬 Comments
5 min read