微学AI
08-04·AI领域创作者
MiniMax H3多模态能力表现如何?
一个模型吃掉PR和AE
以前做一个15秒的电商产品广告,流程是:文生视频出画面,TTS合成旁白,剪映套字幕,AE做产品高光和价格弹跳动画。来回切四五个软件,导出导入转格式,折腾大半天。H3把这套流程塞进了一个模型。你输入一张产品图、一段广告脚本,它一次输出就带上货架运镜、旁白配音、字幕、光影效果,每个视觉元素跟画面的空间和光线都是对齐的,不是简单叠上去。我试了它那个复杂文本保持的能力,品牌logo放到玻璃杯上它理解折射,放墙上理解曲率和纹理,镜头推拉的时候字体不会变形。这背后是Contextual Omni Representation那套东西,把文本、图像、音频、视频当成统一上下文来理解,不是各管各的。当然它也不是完美的,15秒的时长上限对很多场景还不够,复杂多模态指令偶尔会翻车,快速运动场景下画面细节还有提升空间。但方向对了,抠细节是时间问题。后续它还要融合M系列模型的能力,到时候再看。但就目前来说,一个模型吃掉PR和AE这件事,已经不再是概念了。
发布于 福建
1
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn