吃瓜群众嘻嘻
08-07·杭州朝扬企业管理咨询有限公司员工
阿里Wan3.0公测,视频模型或成新战场
Wan3.0 公测第一天,我看到了阿里在视频赛道的野心和焦虑通义万相 Wan3.0 今天公测,我蹲点抢到资格,连跑了 20 个 case。先说结论:视频生成从“能不能动”卷到了“动得好不好看”,阿里这次拿出的东西,有亮点,也有明显软肋。1. 物理一致性:肉眼可见的进步对比上一代,Wan3.0 最大的提升是物体运动不再“飘”。我测了“杯子从桌上滑落摔碎”,碎片轨迹居然符合惯性,地面反弹也有模有样。人物行走时手脚不再“瞬移”,布料褶皱跟随动作变化——这点比可灵早期版本强一个身位。2. 语义遵循:复杂 Prompt 终于听懂了“一个穿红衣服的女人走在雨天东京街头,霓虹灯倒映在水洼中,镜头缓慢推进”——Wan3.0 把红衣、雨天、霓虹倒影、镜头速度变化全做对了。之前的模型经常丢元素,Wan3.0 的多模态对齐确实下了功夫。3. 但别高兴太早:三个硬伤· 时长硬限制:公测版最多 5 秒,Sora 和 Runway 都奔着 10 秒+去了。做叙事短片根本不够,只能算“动图加强版”。· 人物一致性崩塌:同一个角色,3 秒后脸就“换演员”了。多镜头连续生成目前没法用。· 排队排麻了:公测流量挤爆,单次生成等 8-15 分钟。号称的“秒级生成”,等正式版再看吧。4. 视频模型的“新战场”意味着什么?Wan3.0 的发布说明阿里把视频生成提到了大模型同等战略地位。加上可灵、即梦、Sora,下半年视频模型会卷成麻花。但对算法工程师来说,真正的机会不在模型本身,而在“视频工作流”——如何用模型+控制网络+后期处理,做出可商用的视频内容。这条链路上全是坑,也全是机会。
发布于 浙江
分享
评论
未登录
友善发言
image-upload
评论
加载中