乌贼在慕尼黑写BUG
08-04·测试·5年+
MiniMax H3多模态能力表现如何?
15秒2K+原生双声道,H3的硬指标到底怎样?说几个关键数据:输出时长4到15秒,最高2K分辨率(2560×1440),24FPS帧率,32kHz立体声音频。支持21:9、16:9、4:3、1:1等7种宽高比。稳定支持中、英、日、韩等11种语言。H3系统由三个模块组成:H3-Context-IR负责理解复杂的多模态输入并转换成模型能理解的中间表示;H3-Base负责生成768P的音视频;H3-Regenerate-2K再把结果提升到2K。输入方面,最多支持9张图、3段视频、3段音频,合计不超过12个文件。这些参数放在开源模型里算很能打了。而且它已经在Hugging Face上开放下载。对做AI视频相关产品的团队来说,值得花时间研究一下。
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn