一点拾忆
08-08·AI领域创作者
豆包
今日,字节上线了一个叫SeedRealtime的东西。简单说就是:你现在可以跟豆包打视频电话了。不是那种你说话它回文字的"假视频",是真的能同时听声音、看画面、实时对话。你在博物馆举着手机对着文物,它会主动提醒你这是什么;你在操作咖啡机弄错了,它看着画面实时纠正你。旁边的闲聊噪声它分得出来,不会被人搭话就乱触发。技术上这事挺难的。以前做这种交互得串好几个模块——ASR识别语音、视觉模型理解画面、TTS合成回答,一层层叠上去延迟也叠上去了。SeedRealtime把声音、画面、时序和表达全塞进一个端到端模型,不用VAD判断轮次,在连续信息流上同步完成感知、理解、决策和表达。官方数据说节奏问题比传统级联系统少了一半。"边看、边听、边说"这六个字听着简单,做出来的人不多。豆包是第一个把音视频全双工跑通规模化落地的。
发布于 天津
分享
评论
3
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn