FireRedTTS-2 – 面向播客和聊天机器人的AI长对话语音生成
亮点🔥
长对话语音生成:目前支持 4 位说话者的 3 分钟对话,并且可以通过扩展训练语料库轻松扩展到更多说话者的更长对话。
多语言支持:支持英语、中文、日语、韩语、法语、德语、俄语等多种语言。支持零样本语音克隆,适用于跨语言和代码切换场景。
超低延迟:基于新的12.5Hz 流式语音标记器,我们采用了双变压器架构,该架构在文本语音交错序列上运行,从而实现了灵活的逐句生成并减少了首包延迟。具体而言,在 L20 GPU 上,我们的首包延迟低至 140ms,同时保持高质量的音频输出。
强稳定性:我们的模型在独白和对话测试中都实现了高相似度和低WER/CER。
随机音色生成:用于创建 ASR/语音交互数据。
🏷标签:#TTS #AI #语音生成 #源码
☁链接:点击获取
⭐频道 😮群聊 ✏投稿 🌍中文
亮点🔥
长对话语音生成:目前支持 4 位说话者的 3 分钟对话,并且可以通过扩展训练语料库轻松扩展到更多说话者的更长对话。
多语言支持:支持英语、中文、日语、韩语、法语、德语、俄语等多种语言。支持零样本语音克隆,适用于跨语言和代码切换场景。
超低延迟:基于新的12.5Hz 流式语音标记器,我们采用了双变压器架构,该架构在文本语音交错序列上运行,从而实现了灵活的逐句生成并减少了首包延迟。具体而言,在 L20 GPU 上,我们的首包延迟低至 140ms,同时保持高质量的音频输出。
强稳定性:我们的模型在独白和对话测试中都实现了高相似度和低WER/CER。
随机音色生成:用于创建 ASR/语音交互数据。
🏷标签:#TTS #AI #语音生成 #源码
☁链接:点击获取
⭐频道 😮群聊 ✏投稿 🌍中文