杨树散枝
08-04·软件研发·1年
MiniMax H3多模态能力表现如何?
H3最不一样的地方是它不再把文生视频、图生视频、声音、编辑拆成各自独立的模型,而是放进一个统一上下文里理解。官方那个例子很说明问题:参考视频1的运镜、让图2的人物唱歌、声线对齐音频3,只用一句话描述关系,剩下的全模态理解它自己完成。2K直出、原生双声道、15秒时长,加上每帧约0.8元、价格不到主流三分之一,商用门槛被明显压低。近期还要开源,企业能本地部署。H3的意义不在单项指标多强,而在把多模态内容生产从拼工具变成说人话。对做电商、广告、短片的团队,这是个实在的变化。
发布于 江西
分享
评论
未登录
友善发言
image-upload
评论
加载中