王西蒙AI创客
08-05·AI领域创作者
字节发布音视频全双工大模型,已上线豆包
字节8月5日发布SeedRealtime,原生音视频全双工大模型。豆包App全量上线,点“打电话”就能视频通话。传统方案是ASR加视觉模型加TTS多个模块串联,延迟和信息损耗都大。SeedRealtime用统一端到端架构,原生融合音频、视频和文本。能“边看、边听、边说”,实时交互。复杂场景下表现不错。机场嘈杂环境能区分用户和旁人对话,避免误触发。端到端评测显示节奏问题减少约50%,抢话、回应延迟、背景噪声误触发都明显下降。但全双工不是新概念,语音助手早就有了。SeedRealtime真正的新东西是“视频加语音加文本”三模态同步处理。能不能真正好用,得看实际体验,不是看发布会的PPT。
发布于 四川
分享
评论
1
未登录
友善发言
image-upload
评论
加载中