本地部署,视频音画一体开源大模型MiniMax H3
本地部署,开源模型,MiniMaxH3,文生视频,图生视频

MiniMax(稀宇科技)2026‑07‑31 发布的全模态 AI 视频生成大模型,国内主打音画一体生成,可 API 调用、部分权重开源MiniMax。
核心规格
- 参数:33.1B 稠密 Transformer 架构
- 输出:4‑15 秒视频,24fps;默认 768P,可输出原生 2K;原生 32kHz 立体声(视频、音频同一轮生成,不是后期拼接)MiniMax
- 画幅:9:16、16:9、1:1 等多种比例,适配短视频、广告MiniM…
- 输入:同时支持文本、多张图片、参考视频、参考音频做条件控制,支持动作迁移、角色参考、风格参考minimaxh3….
- 语言:稳定支持中文、英语等 11 门语言MiniMax
最大特点
- 音视频同生:生成画面同时直接出音效 / 人声,不用分开跑 TTS + 视频再合成,很适合做科普短片、产品短视频、广告片。
- 强参考控制:喂图、参考片段、参考音频,就能锁定人物、动作、风格、声音,对做系列化短视频友好minimaxh3….。
- 商用性价比高:API 单价显著低于海外同类视频模型,面向广告、电商、短视频创作者、开发者MiniMax。
- 支持视频局部重绘、指令式编辑成片视频;部分权重开源(社区许可,不是完全无限制开源)火山引擎开…。
适合场景
- 短视频 / 科普动画、产品演示、广告短片、故事短片;
- 开发者通过 API 批量生产带配音的短视频内容。
局限
- 单次最长15 秒,不能直接生几分钟长片;
- 2K 是二次重生成模式,速度会变慢;完整本地部署对显存要求很高。

链接:https://pan.quark.cn/s/3c4f5a30f6b7
© 版权声明
文章版权归作者所有,未经允许请勿转载。



