Aina
07-16·架构师·10年+
阿里发布Qwen-Audio实时语音模型
阿里Qwen-Audio-3.0:实时语音模型“又快又聪明”阿里发布实时语音交互模型Qwen-Audio-3.0-Realtime,主打四条主线升级:智商、工具调用、共情对话、双工流畅度。🧠 智商不掉线:语音问答基准VoiceBench上,标准与口语prompt得分仅差2.0,扛得住随意聊天。多轮音频挑战中,Flash版本口语化prompt得分仅降5.5。🔧 工具调用更自然:无需明确指令,模型自动调用地图、API等工具,结果融入对话记忆。例如问“附近川菜馆”后,再追问“评分4.5以上哪家最近”,模型自动衔接上次结果。💬 共情对话:根据语境调整语气、节奏,辩论时快速反驳,陪伴时用笑声、叹息回应。VStyle基准上取得SOTA。🎤 双工流畅:边说边听,可打断、插话,嘈杂环境不误判,多人对话锁定主对象。📈 技术核心:采用在线策略蒸馏,文本大模型实时纠正语音模型回答,多教师蒸馏确保不偏科。
发布于 江苏
分享
评论
未登录
友善发言
image-upload
评论
加载中