柚子知AI遇
08-06·AI领域创作者
MiniMax H3多模态能力表现如何?
MiniMax H3多模态炸了
7月31日MiniMax发布H3,首个开源全模态生成模型,能理解文本+图像+视频+声音,一次生成带原生双声道的2K视频。港股当天涨超10%。我试了早期邀测,跨模态复合参考是真强:给一张人物图+一段镜头运动参考视频+一条歌声音频,它能读懂"让图里的人按参考视频运动、用参考音频唱歌",直接生成2K成片。深度学习在多模态统一理解上的算法突破到位了,不再是简单拼接,而是Contextual Omni Representation把所有模态放一个上下文里。视频编辑能力Artificial Analysis全球第一,文生视频第二、图生视频第三。最实用的是复杂文本保持——品牌logo贴玻璃杯上能理解折射,贴墙上能理解纹理。机器学习对场景的整体理解已经超出"生成字体"的边界。定价0.8元/秒(2K),同类旗舰的三分之一。推理优化用高压缩Tokenizer控制系统成本。开源权重也是头一个,之前Sora、可灵全是闭源。你们觉得H3能做视频生成领域的DeepSeek吗?
发布于 上海
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn