johnnykent
07-20·海口市俚米科技有限公司员工
字节发布音频创作模型
其核心能力主要体现在以下方面:多要素统一编排,支持精细的时间控制:一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。音色风格可控,长时稳定:支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。多语种自然生成:支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。项目主页:
https://taou.cn/a/iH6yso技术路径:从拼接生成到完整场景生成传统音频内容生产依赖多环节拼接。为实现完整声音场景的直接生成,模型需跨越三大技术门槛:细节保留:兼顾语音的清晰度与韵律,以及环境声的空间氛围稳定性;场景理解:建模各音频要素间的时间、情绪与声学互动关系;多指令控制:服从文本、参考音频、时间轴、角色设定等多种条件约束。Seed Audio 1.0 的核心思路是将不同音频要素置于统一框架下理解与生成,通过训练通用声学编码器,将各类音频映射至统一的声学表征空间,而非作为独立任务分别处理。这种联合建模方式使模型能更自然地组织角色语气、背景氛围与声音节奏,输出更接近完整作品而非素材拼接。基于此,模型可生成兼具角色互动、情绪推进与氛围营造的复杂音频,适用于专题叙事、剧情对话、主播互动等典型场景。在创作过程中,用户可先将意图拆解为结构化时间线,明确角色、台词、情绪与音效的进入时机,从而精确控制声音的起止、衔接与叙事配合。
发布于 海南
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn