通义实验室宣布正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型。本次更新主要集中在:更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及在参考音频不清晰时的鲁棒性。 本次发布包含两个版本: Flash:面向实时交互,首包延迟在 300ms 左右。 Plus:面向高质量生成,在自然度和音色还原度上表现更佳。 Qwen-Aud...
📖 本文为摘要内容,仅显示部分信息。
阅读原文评论 (0)
暂无评论,来写第一条吧
通义实验室宣布正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型。本次更新主要集中在:更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及在参考音频不清晰时的鲁棒性。 本次发布包含两个版本: Flash:面向实时交互,首包延迟在 300ms 左右。 Plus:面向高质量生成,在自然度和音色还原度上表现更佳。 Qwen-Aud...
📖 本文为摘要内容,仅显示部分信息。
阅读原文暂无评论,来写第一条吧