夜勤月
08-04·AI领域创作者
MiniMax H3多模态能力表现如何?
H3开源,多模态的DeepSeek时刻
H3发布后很多人在讨论它的视频生成质量。但在我看来,这款模型真正的意义不在某个单项跑分,而在于它是第一个把文本、图像、视频、声音全部统一进同一个上下文的开源模型。以前做多模态应用,你得拼好几个模型:一个理解图片,一个生成视频,一个处理音频,中间还要自己搭管线做衔接。H3把这些事压到一个模型里,0.8元每秒的定价只有同类旗舰的三分之一。这跟当初DeepSeek R1开源的逻辑很像——闭源模型走通了某条路,然后有人把同等水平的东西开源出来。区别是R1针对语言推理,H3针对的是多模态生成。我的判断是,H3短期内不会让闭源视频模型失去市场,但它会大幅降低多模态应用的工程门槛。当团队不用从零搭管线、不用为每个模态单独付费时,更多场景才真正跑得起来。
发布于 江西
1
14
10
未登录
友善发言
image-upload
评论
加载中