满眼星河12138
08-04·AI领域创作者
MiniMax H3多模态能力表现如何?
Seedance和H3,视频生成怎么选?
MiniMax H3多模态能力表现如何?
H3支持原生多模态理解与生成,你可以上传文字、图片、音频、视频等多种输入,也可以直接让H3生成缺失的那个模态。这不是“多模态拼接”,是把整段素材当成统一上下文,让模型理解各种元素的关系。导演级指令跟随测试里,H3能精确执行复杂的灯光变化指令,烛光、硬光、彩虹折射、红蓝对打、金色逆光依次出现且过渡平滑。给视频里的人物配音、改变台词,H3能同时适配音色和嘴形。已经不只是“生成画面”了,是在“理解画面之后生成声音”。自研VAE把视频压缩率做到了行业最高水平,同样一段视频,序列长度直接省了4倍。训练便宜了,推理也便宜了。不把低清视频当作唯一依据,而是把它当作一种参考,连同原始多模态上下文一起输入,复用H3的理解能力生成高分辨率画面。H3宣布近期开源。视频生成赛道之前被Seedance、可灵等闭源模型主导。H3开源之后,开发者终于可以免费部署一个性能逼近闭源旗舰的多模态模型了。一个开源的全模态统一模型,能力无限逼近了闭源最强模型。
发布于 中国香港
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn