一点拾忆
08-08·AI领域创作者
豆包
今日,字节上线了一个叫SeedRealtime的东西。简单说就是:你现在可以跟豆包打视频电话了。不是那种你说话它回文字的"假视频",是真的能同时听声音、看画面、实时对话。你在博物馆举着手机对着文物,它会主动提醒你这是什么;你在操作咖啡机弄错了,它看着画面实时纠正你。旁边的闲聊噪声它分得出来,不会被人搭话就乱触发。技术上这事挺难的。以前做这种交互得串好几个模块——ASR识别语音、视觉模型理解画面、TTS合成回答,一层层叠上去延迟也叠上去了。SeedRealtime把声音、画面、时序和表达全塞进一个端到端模型,不用VAD判断轮次,在连续信息流上同步完成感知、理解、决策和表达。官方数据说节奏问题比传统级联系统少了一半。"边看、边听、边说"这六个字听着简单,做出来的人不多。豆包是第一个把音视频全双工跑通规模化落地的。
发布于 天津
分享
评论
3
未登录
友善发言
image-upload
评论
加载中