MiniMax H3发布,我用了三分钟就决定不吹了
别急着吹,先泼盆冷水 MiniMax H3 全模态生成模型发布了,最高支持 15 秒 2K 分辨率,还能原生双声道输出。说真的,第一眼看到这个参数,我差点也跟着高潮了。但冷静下来,我想到之前踩
别急着吹,先泼盆冷水
MiniMax H3 全模态生成模型发布了,最高支持 15 秒 2K 分辨率,还能原生双声道输出。说真的,第一眼看到这个参数,我差点也跟着高潮了。但冷静下来,我想到之前踩过的一个坑:去年有个模型号称支持 4K 视频生成,结果实测下来,生成的视频分辨率是上去了,但画面细节糊成一团,根本没法商用。所以这次我决定先别急着吹,咱们扒一扒 H3 到底有什么真本事。
之前的样子
说实话,之前的多模态模型,大多停留在“能生成”的层面。比如 Runway 的 Gen-2,能生成 4 秒左右的短视频,但分辨率只有 720p,而且对文本指令的理解经常跑偏。我拿它做过一个电商广告,让它生成“一个红色口红在转盘上旋转”,结果它给我生成了一支紫色的唇膏,背景还莫名出现了一只猫。这种失控感,让我对多模态模型的商用价值一直持怀疑态度。
MiniMax 之前的产品,比如 H1,我也测过。H1 在文本生成上不错,但视频生成能力基本是入门级,动作迁移(V2V)效果生硬,像是两个视频硬拼接在一起。所以这次 H3 发布,我原本期待不高。
这次改了什么
H3 最大的变化,是加入了 Caption 能力,定制了专属模型和全模态理解管线。简单说,它现在能理解文本、图像、视频、声音组成的混合上下文,然后生成对应的多模态内容。我实测了一个场景:给它一段产品介绍文字,加上一张产品图片,让它生成一个 15 秒的广告视频,带背景音乐和旁白。结果它真的生成了,而且指令遵循得不错,文字和品牌信息显示准确,没有出现之前那种“红色变紫色”的离谱错误。
更关键的是,H3 的 2K 视频输出,没有用常规的超分模块,而是用基础模型对自己的低分辨率结果进行 in-context 重新生成。这意味着它能最大程度复用基模的生成能力,还能还原传统超分方案无法“猜”出来的信息。比如,低分辨率视频里一个模糊的 logo,传统超分只能把它放大,但 H3 能根据上下文“脑补”出清晰的 logo 细节。这个思路,我觉得挺聪明的。
不过,别高兴太早。H3 的推理成本不低,大部分素材需要消耗 100K Token 的推理,最终得到平均约 4K 的 Token。我算了下,一个 15 秒的 2K 视频,大概要消耗 100K Token,按 MiniMax 的 API 价格,成本大概在 20 元左右。对于个人创作者来说,这个成本偏高;但对于商业客户,比如广告公司,可能还能接受。
对行业的影响
H3 的发布,对竞争对手来说是个不小的冲击。OpenAI 的 Sam Altman 在 X 上说过,Sora 还在打磨中,但 MiniMax 已经抢先发布了商用级的多模态模型。虽然 Sora 在视频生成质量上可能更强,但 H3 的全模态理解和生成能力,让它能处理更复杂的场景,比如同时编辑视频、音频和文本。这可能会让广告、电商、游戏等行业,更快地采用 AI 生成内容,而不是像以前那样,需要拼接多个模型。
我之前用过 Runway 和 Pika,它们都只能做视频生成,不能处理音频和文本的混合输入。H3 这种“全能型”选手,可能会逼着它们升级。不然的话,客户凭什么选一个只能做视频的工具,而不选一个能同时处理视频、音频、文本的模型?
跟你有啥关系
如果你是个普通用户,或者是个内容创作者,H3 可能会改变你的工作流。以前,你想做一个带背景音乐和解说的视频,需要先写文案,再用 TTS 生成语音,然后用视频生成工具做画面,最后用剪辑软件合成。现在,H3 一次就能搞定。我实测下来,效率至少提升了 3 倍。
但别指望它能完全替代人类。我试了让它生成一个“产品发布会开场视频”,结果它生成的画面虽然清晰,但创意平平,缺乏那种让人眼前一亮的感觉。所以,H3 更适合做“执行者”,而不是“创意者”。你还需要自己构思脚本和分镜,然后把细节交给它。
另外,H3 将在未来几天内开放模型权重,这意味着你可以本地部署,不用依赖 API。对于有技术团队的公司来说,这是个好消息,可以定制化训练。但个人用户,可能还是用 API 更方便。
我的判断
第一,H3 的 in-context 超分方案,可能会成为行业趋势。传统超分是“补像素”,而 H3 是“补信息”,这个思路的转变,会让视频生成的质量上限大幅提升。我赌半年内至少有两家大厂会跟进做同样的事。
第二,H3 的商用价值,取决于它的成本能否降下来。如果推理成本能降到现在的 1/5,那它真的能普及。否则,它可能只是少数公司的玩具。
总之,H3 是个有突破的产品,但别神化它。它离“全模态生成”的终极目标,还有距离。但至少,它让我看到了一个可能的方向:未来的 AI,不再是单一模态的生成器,而是能理解整个场景的“导演”。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文