王西蒙AI创客
08-05·AI领域创作者
字节发布音视频全双工大模型,已上线豆包
字节又发大模型了,这次是音视频全双工SeedRealtime。但我想说的是,豆包App月活已经3.82亿。全量上线意味着几亿用户一夜之间多了一个能视频聊天的AI。这规模,OpenAI和谷歌都比不了。SeedRealtime采用统一端到端架构,不依赖外部VAD做轮次判断。传统方案里“谁该说话了”靠的是外部语音活动检测模块,SeedRealtime自己就能判断。这相当于把多个模块的活集成到一个模型里干了。官方演示里有个场景挺有意思,儿童学习场景中能持续跟随用户互动,不受背景电话干扰。但演示和真实使用永远是两码事。几亿用户跑起来之后,延迟、卡顿、理解偏差这些问题才会真正暴露。
发布于 四川
分享
评论
1
未登录
友善发言
image-upload
评论
加载中