7G冲浪选手
08-05·咨询顾问·10年+
字节发布音视频全双工大模型,已上线豆包
8月5日,字节跳动正式发布了原生音视频全双工大模型SeedRealtime,并已在豆包App全量上线。它用统一端到端架构原生融合了音频、视频和文本,能在连续的多模态信息流上同步完成感知、理解、决策与表达。跟过去那种把ASR、视觉模型、TTS等多个模块串起来的“级联系统”相比:· 节奏问题减少了一半:抢话、回应迟缓、被背景噪声误触发的情况大幅改善。· 交互更自然:不需要依赖外部VAD来判断轮次,不再是一问一答的半双工模式。官方演示了几个挺有意思的场景:· 在多人聚会中识别不同人物身份并持续对应发言者。· 帮外国游客实时理解中文菜单和服务员介绍。· 在博物馆持续观察镜头画面,识别指定文物后主动提醒。· 辅助用户操作咖啡机并根据画面变化实时纠错。· 阅读论文时持续监测翻页过程,在指定章节出现后自动提示。
发布于 四川
2
评论
3
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn