王西蒙AI创客
08-05·AI领域创作者
字节发布音视频全双工大模型,已上线豆包
字节8月5日发布SeedRealtime,原生音视频全双工大模型。豆包App全量上线,点“打电话”就能视频通话。传统方案是ASR加视觉模型加TTS多个模块串联,延迟和信息损耗都大。SeedRealtime用统一端到端架构,原生融合音频、视频和文本。能“边看、边听、边说”,实时交互。复杂场景下表现不错。机场嘈杂环境能区分用户和旁人对话,避免误触发。端到端评测显示节奏问题减少约50%,抢话、回应延迟、背景噪声误触发都明显下降。但全双工不是新概念,语音助手早就有了。SeedRealtime真正的新东西是“视频加语音加文本”三模态同步处理。能不能真正好用,得看实际体验,不是看发布会的PPT。
发布于 四川
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn