MiniMax H3 于 2026 年 7月 31 日发布,到今天刚好过去一个月。
过去提到 AI 视频,大家首先关注的是画面是否真实、人物会不会变形、运镜有没有电影感。但真正用 AI 做过商业内容的人会发现,画面漂亮只是第一步。
一条可以交付的广告、电商视频或者游戏 PV,通常还需要:
- 人物和产品保持一致;
- 字幕、标题和品牌文字不能乱码;
- 转场要与音乐节奏匹配;
- 图形、UI、Logo和画面能够同时出现;
- 客户要求换产品、换服装时,不能整条视频推倒重做。
从官方案例和首批公开测试来看,MiniMax H3 最有价值的地方,并不是单纯把画面生成得更真实,而是开始理解一条“成片”应该如何组织。
一、H3更像是在“设计视频”
很多视频模型擅长生成一个动态场景。
比如一个人在街上奔跑、一辆汽车驶过城市,或者一个角色站在镜头前说话。这类视频单独看很漂亮,但距离广告、电商视频和品牌宣传片,往往还差一轮完整的后期制作。
H3的特点,是可以把下面这些元素放进同一条视频:
- 人物和产品;
- 标题、字幕和动态文字;
- 装饰图形和UI界面;
- 音乐、音效和节奏点;
- 转场、Logo和品牌包装。
更重要的是,这些内容并不是简单堆在一起。
从公开的音乐 MV、商品广告和角色 PV 案例来看,人物主体通常仍然保持在视觉中心,文字承担信息传递,图形负责氛围和装饰,转场则配合音乐节奏。
元素虽然多,但信息层级仍然比较清楚。
这也是 H3 与很多传统视频生成模型不太一样的地方:其他模型更像虚拟摄影机,H3 则更接近一个同时参与拍摄、剪辑和包装的视频设计工具。
二、文字稳定性对商业视频非常重要
AI 视频最容易穿帮的地方,往往不是人物,而是文字。
一条产品广告前面都很正常,最后商品包装上的品牌名称变成乱码,整条视频就很难直接使用。
电商视频、活动宣传片和游戏 PV 又偏偏离不开文字:
- 产品名称;
- 商品包装;
- 活动日期;
- 促销信息;
- 游戏技能名称;
- Logo和品牌口号。
在公开对比案例中,H3 对商品包装和画面中文字的保持能力表现得比较突出。特别是在画面运动、镜头切换和产品旋转时,文字没有那么容易立刻崩坏。
当然,这并不代表 H3 可以保证每一次生成的文字都百分之百正确。但对商业创作者来说,只要能够减少因为文字错误而重新抽卡的次数,就能同时节省生成费用和后期修复时间。
三、可以同时参考图片、视频和声音
传统图生视频通常只能给模型一张首帧图片,再配上一段提示词。
H3支持更加完整的多模态输入,可以同时理解:
- 文字提示词;
- 角色或产品图片;
- 参考动作和运镜的视频;
- 音乐、台词和环境声音。
目前全能参考模式最多支持12个文件,包括最多9张图片、3段视频和3段音频。
这意味着我们不必把所有要求都写进提示词。
例如制作一条产品广告时,可以这样提供素材:
图片1:产品外观 图片2:品牌Logo 图片3:参考场景 视频1:希望模仿的镜头运动 音频1:广告配乐 文字:产品卖点和画面要求模型可以同时参考产品、人物、动作、镜头、风格和声音,而不是只根据一段文字猜测用户的意图。
对于不擅长写复杂提示词的人来说,这种方式更容易控制结果。
四、复杂转场和音乐卡点是H3的强项
一条普通 AI 视频可能只需要人物动起来,但 MV、品牌片和活动宣传视频需要更复杂的节奏。
公开案例中,H3可以在十几秒的视频里连续切换多个场景,并让场景变化跟随人物动作或者音乐节拍发生。
它比较适合处理:
- 音乐MV;
- 动态字幕;
- 产品快速展示;
- 游戏角色PV;
- 活动开场视频;
- 品牌Logo演绎;
- UI和科技感界面动画。
这类内容最大的难点不是“炫”,而是炫完之后观众仍然知道视频在表达什么。
H3在文字、人物、装饰元素和节奏之间的组织能力,是它目前比较明显的优势。
五、视频生成之后还能继续修改
H3另一个值得关注的能力,是对已有视频进行编辑。
例如在保持原有镜头和人物动作的前提下:
- 将可口可乐替换成百事可乐;
- 将人物的短袖替换成西装;
- 将夜晚场景调整成白天;
- 更换产品颜色;
- 删除或增加某个物体;
- 修改背景和光线。
传统的视频生成模型经常出现“改一个地方,其他地方也跟着变化”的问题。
用户只是想更换产品,结果人物长相、镜头位置和场景构图也一起变了。对于商业项目来说,这几乎等同于重新生成。
从公开案例来看,H3更强调局部修改,同时尽量保持没有被要求修改的部分不变。
这项能力不一定比生成一条全新视频更吸引眼球,但在实际工作中非常有价值。
因为客户最常说的话并不是“重新做一条”,而是:
产品换一下,衣服改一下,背景亮一点,其他地方不要动。
如果一条素材能够反复修改和复用,节省的不只是模型费用,还有重新剪辑、配音和审核的时间。
六、适合哪些商业场景?
结合目前展示出来的能力,H3比较适合以下方向。
1. 电商和产品广告
它可以同时处理产品、模特、包装文字、卖点字幕和音乐节奏,适合制作商品展示、上新宣传和信息流广告。
2. 品牌宣传片
H3对Logo、图形、动态文字和转场的处理,让它更适合需要视觉包装的品牌内容。
3. 音乐MV和动态歌词
可以参考音乐节奏设计场景变化,并加入动态字幕和视觉特效。
4. 游戏和角色PV
适合根据角色设定图生成角色展示,也可以根据游戏截图模拟第一人称移动、射击和镜头跟随。
5.短剧和连续内容
通过角色图片、参考视频和声音控制人物与表演,降低不同镜头之间人物不一致的问题。
七、好用之后,价格优势才有意义
如果模型效果不能使用,再便宜也是浪费钱。
H3值得讨论价格,是因为它在商业包装、多模态控制、文字稳定和视频编辑方面已经具备了一定的实用性。
截至2026年8月31日,官方按量价格如下:
| 模型 | 分辨率 | 价格 |
|---|---|---|
| MiniMax H3 Max | 480P | 0.33元/秒 |
| MiniMax H3 | 768P | 0.50元/秒 |
| MiniMax H3 | 2K | 0.80元/秒 |
一条15秒的H3视频:
- 768P约7.5元;
- 2K约12元。
价格低只是第一层优势。更重要的是,如果文字更稳定、参考素材更准确、局部修改不用重新生成,实际项目中的总成本还会进一步下降。
八、预算有限,可以采用这套工作流
不要一开始就使用2K反复抽卡。
更省钱的流程是:
5秒短片测试提示词 ↓ 使用480P或768P验证人物、动作和镜头 ↓ 加入产品、文字、音乐和包装元素 ↓ 选出可以使用的版本 ↓ 修改局部问题 ↓ 最后再输出2K例如生成10个5秒的方案:
- 全部直接生成2K,需要约40元;
- 先用H3 768P生成,需要25元;
- 选中一个版本后再升级到2K,增加约1.5元。
总成本约26.5元,比所有方案都直接生成2K节省约三分之一。
H3能不能替代Seedance?
目前还不能简单地下这个结论。
如果追求人物质感、大场面和更强的电影感,Seedance依然有自己的优势。
如果需求是广告、电商、游戏PV、动态字幕和品牌包装,H3的优势会更加明显:
- 更擅长组织文字、图形和人物;
- 多模态参考能力更完整;
- 局部编辑更加实用;
- 生成价格相对较低;
- 更适合需要频繁修改的商业项目。
两者不是简单的谁取代谁,而是擅长的方向不同。
总结
MiniMax H3真正值得关注的,不只是0.8元一秒的2K视频。
它的核心价值是开始把人物、产品、文字、图形、声音、镜头和节奏作为一条完整视频来处理。
简单概括就是:
过去的AI模型更擅长生成漂亮画面,H3更擅长把画面组织成可以使用的内容。
对于个人创作者、小型电商、独立开发者和预算有限的内容团队来说,“效果能够交付”加上“生成价格足够低”,才是H3最有竞争力的地方。