微学AI
08-03·AI领域创作者
Seedance2.5视频生成强在哪里?
拆解Seedance的技术家底
翻了几篇Seedance 2.0的技术报告,有个点让我挺意外。它是视频生成领域第一个完整用MoE架构的模型,参数规模两千亿级别。MoE在大语言模型里已经很成熟了,但搬到视频生成上确实是头一次,好处是每次推理只激活一部分专家,计算效率比同参数量的密集模型高很多。视频生成这种算力黑洞场景,效率就是命。另一个让我眼前一亮的是双分支扩散架构,音频和视频走两条独立的扩散链路并行生成再对齐,不是传统的先出无声视频再配音。实测音画同步误差不到0.1秒,口型对得上,环境音效和画面动作有因果关系。导演级镜头调度是最让我服气的,我试着输入"雨天的咖啡馆,女人放下杯子转身离开",它直接给了全景到中景再到特写的镜头序列,转身那一下还带了跟焦。物理仿真也没翻过车,液体流动、布料飘动、物体碰撞都很自然,不是靠堆数据硬学统计规律,是把物理引擎的逻辑嵌进了生成过程。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中