大厂职场观察者
08-04·测试·5年+
MiniMax H3多模态能力表现如何?
多模态的“大一统”,终于有人把这事儿干了
以前做视频,得先有个文案,再找图,再配乐,再剪辑,每一步都得换不同的工具。H3这次干的事,就是把文本、图片、视频、音频全塞进一个模型里统一处理。你上传一段参考视频、一张场景图、一段音频,再用文字描述一下想要的效果,H3能一次性理解所有输入之间的关系,直接输出带原生双声道音轨的2K成片。官方管这个叫“多模态上下文理解”。说白了,就是把以前割裂的“文生视频”“图生视频”“视频编辑”“配音”这些任务,全部打通了。而且它默认就给你2K分辨率,不用再额外超分。在多模态这个赛道,H3可能是第一个真正意义上的“全模态统一模型”。开源之后,估计会有不少团队基于它做二次开发。
发布于 北京
分享
2
2
未登录
友善发言
image-upload
评论
加载中