忙碌的昆西在旅游
08-13·技工·4年
字节发布SeedRealtime双工模型
豆包SeedRealtime的发布,直接把实时音视频交互的竞争拉到了新高度。它没有走GPT-live纯语音、Gemini-live只能看画面的老路,而是把画面、音频、时间轴全部塞进一个端到端模型里,让视觉信息从一开始就参与判断。这不是简单的功能叠加,而是在解决“什么时候该开口”这个核心交互难题。但技术领先不代表体验完美,抢话、卡顿这些问题虽然被砍了一半,要真正做到像真人一样自然对话,还有很长的路要走。你觉得实时音视频AI,最先会在哪个场景里真正普及?
发布于 新疆
分享
评论
未登录
友善发言
image-upload
评论
加载中