FireRedTTS3多语言与中文方言克隆实战:如何合成自然的四川话、粤语和日语
【免费下载链接】FireRedTTS3FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing项目地址https://gitcode.com/gh_mirrors/fi/FireRedTTS3点击查看免费下载FireRedTTS3 是一个开源的多语言 TTS文本转语音声音克隆系统只需一段参考音频就能用同一个音色合成 24 种语言含粤语、日语和 21 种中文方言含四川话的语音还能用自然语言指令设计新嗓音和编辑录音。本文带你从零部署到实操一步步合成自然的方言语音。 为什么 FireRedTTS3 能说得像本地人普通 TTS 换个语言就变味而 FireRedTTS3 基于**语义增强的连续语音表征RedAE**构建把音频压缩成信息密度更高的表征后再由扩散模型解码因此音色、口音、语速都能从参考音频里完整继承。它提供两个版本版本核心能力适合场景FireRedTTS3-Base24 语言 21 中文方言零样本声音克隆用指定音色读方言、读外语文案FireRedTTS3-Instruct指令式嗓音设计 语义/声学语音编辑无参考音频造音色、改词改语速整体架构如下图所示左侧 RedAE 负责音频压缩中间是 Base 声音克隆模型右侧 Instruct 支持指令驱动的设计与编辑 一键安装步骤3 分钟完成部署1. 克隆仓库并安装依赖pip install -r requirements.txt依赖清单见 requirements.txt。2. 下载预训练模型二选一# 方式一Hugging Face pip install huggingface_hub[cli] hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/ # 方式二ModelScope pip install modelscope modelscope download --model FireRedTeam/FireRedTTS3 --local_dir pretrained_models/3. 启动 Gradio 网页界面最简单的方式无需写代码pip install gradio python gradio_base.py --host 0.0.0.0 --port 7860 # Base 声音克隆 python gradio_instruct.py --host 0.0.0.0 --port 7860 # Instruct 设计/编辑启动后浏览器打开http://0.0.0.0:7860即可使用左右两栏分别是 Base 克隆与 Instruct 编辑界面️ 方言合成核心技巧提示音频必须对口这是整篇文章最重要的一句话FireRedTTS3 的输出会继承参考音频prompt的说话风格所以想合成四川话就给一段四川话的参考音频想合成日语就给一段日语参考音频。在网页界面中只需 4 步Language / Dialect下拉框选择目标语言例如Sichuan (四川话)、Cantonese (粤语)、Japanese (日文)上传或点击上传Prompt Audio目标方言/语言的参考语音填写Prompt Transcript参考语音对应的文字在右侧输入要合成的文本点击Generate Speech。界面为每个语言/方言都预置了地道示例文案可以直接照着录一段参考音频例如来自 gradio_base.py标签示例文案ZH_Sichuan四川话今天天气安逸得很我们两个一路去公园耍哈吃顿火锅。Cantonese粤语我哋聽日夜晚八點喺茶餐廳食飯順便傾下嗰個合作計劃埋單大概兩百蚊。Japanese日语会議は2024年5月10日午前10時に始まります。参加費用は¥1,500です。 支持的方言标签完整列表ZH_Sichuan、ZH_Minnan、ZH_Shanghai、ZH_Tianjin、ZH_Wu等共 21 种多语言共 24 种完整清单见 fireredtts3/core.py 的FireRedTTS3类。⌨️ Python API10 行代码生成方言语音想批量合成时直接用 Python API入口为 fireredtts3/core.py 中的FireRedTTS3from fireredtts3.core import FireRedTTS3 import torchaudio tts FireRedTTS3(pretrained_models, use_wetextTrue) prompt_audio, sr torchaudio.load(sichuan_prompt.wav) # 四川话参考音频 gen_audio, gen_sr tts.generate( languageZH_Sichuan, # 目标方言标签 prompt_text参考音频的原文字, prompt_audioprompt_audio, prompt_audio_srsr, text走去耍哈儿嘛今天天气巴适得板, ) torchaudio.save(gen_sichuan.wav, gen_audio.cpu(), gen_sr)把language换成Cantonese、Japanese即可切换粤语和日语。推理细节扩散步数、CFG 引导、停止阈值可在 fireredtts3/llm/fireredtts3_base.py 的generate方法中查看。✍️ 进阶Instruct 指令式嗓音设计与语音编辑没有合适的参考音频用FireRedTTS3-Instruct直接写一个出来嗓音设计generate_voice_design(instruction..., text...)—— 输入一个年轻女性的温柔嗓音语速稍慢带一点俏皮模型会先规划音色属性再合成无需任何参考音频语义编辑generate_semantic_edit(...)—— 对已有录音做插入/删除/替换例如把 cats 换成 dogs保留原音色声学编辑generate_acoustic_edit(...)—— 按模板指令调语速0.5x–2.0x、音高±6 半音、音量0.3x–2.0x。界面入口见 gradio_instruct.py核心实现位于 fireredtts3/llm/fireredtts3_instruct.py。⚙️ 效果与调优技巧官方基准成绩Base 版在 Seed-TTS-eval 上平均词错率3.04%、说话人相似度78.8%同类第一梯队24 语言平均 WER 仅3.754%相似度84.8%。实际调优记住这 3 点文本前端按语言选本地wetext前端只支持中/英合成日语、俄语等外语时建议启用 LLM 前端use_llm_tnTrue需配置.env各语言模板见 fireredtts3/utils/llm_tn/templates/参考音频质量决定上限选 3–10 秒、无背景音乐、口音纯正的干净音频控制随机性界面里调整 CFG guidance scale越高越贴合提示和 Random seed同种子结果可复现参数逻辑在 fireredtts3/core.py 的generate中。按以上步骤操作你已可以稳定产出自然的四川话、粤语和日语语音——从本地部署到批量 API 调用FireRedTTS3 的多语言方言声音克隆能力基本开箱即用。赞分享【免费下载链接】FireRedTTS3FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing项目地址https://gitcode.com/gh_mirrors/fi/FireRedTTS3点击查看免费下载相关推荐一文读懂CosyVoice多语言合成中文、日文、粤语效果实测一文读懂CosyVoice多语言合成中文、日文、粤语效果实测 你是否在寻找一款能流畅合成多语言语音的工具是否为不同语言的语音合成质量参差不齐而烦恼本文将通语音音频人工智能大模型微调预训练模型推理服务FireRedTTS3是什么24语言21中文方言开源TTS语音克隆系统完整介绍FireRedTTS3是什么24语言21中文方言开源TTS语音克隆系统完整介绍 FireRedTTS3 是一个开箱即用的开源 TTS 语音克隆系统 一套模OpenVoice跨语言克隆实战中文语音克隆英语发音示例OpenVoice跨语言克隆实战中文语音克隆英语发音示例 引言打破语言壁垒的语音克隆技术 你是否遇到过这些场景录制多语言教学视频时需要专业配音跨境电商广人工智能语音音频创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考