10 分钟语音训练变声模型:RVC 最短上手路径
10 分钟语音训练变声模型RVC 最短上手路径【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI手机备忘录里只有十几分钟自己的录音就想做出一个能以你声音说话的模型Retrieval-based-Voice-Conversion-WebUI下称 RVC就是冲这个场景来的10 分钟语音数据训练变声模型网页界面点几下就能出活。读完这篇你会在自己电脑上把它从零跑起来并拿到一个能试听的音色。top1 检索堵漏音RVC 凭什么用 10 分钟数据出活把变声想成修音师的工作先把说了什么从原始录音里剥出来再给内容套一层目标音色的皮肤。RVC 在推理时会做 top1 检索——从训练集里找与输入最接近的源特征直接替换掉你输入的特征。这一下把模型顺带学会你原本音色的泄漏通道堵死了也是项目名里 Retrieval 的含义。拿它跟同类方案比有三点值得留意多数音色克隆工具要几小时录音才稳RVC 十分钟就能出可用效果数据门槛低一个量级消费级显卡就能完成训练不用租服务器工具链是打包的UVR5 人声/伴奏分离、RMVPE 音高提取专治哑音都在项目里不用自己接三套工具。RVC 环境搭建从 clone 到预模型就位依赖装在 Python 3.8 以上环境poetry 路线建议 3.7–3.10新版会跟 llvmlite 冲突pip 路线则没有这个限制。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUIPyTorch 单独先装装过就跳过pip install torch torchvision torchaudioWindows RTX 30 系Ampere 架构建议给这条命令加上 cu117 源CUDA 版本对不上会白查半天。然后按你的显卡选一份依赖清单pip install -r requirements.txt # N 卡 # A 卡 / I 卡DirectML: pip install -r requirements-dml.txt # A 卡 ROCmLinux: pip install -r requirements-amd.txt # I 卡 IPEXLinux: pip install -r requirements-ipex.txtROCm 用户记得确认当前用户已加入 render 和 video 组个别卡号还需设置 HSA_OVERRIDE_GFX_VERSION这些细节 README.md 里有原文。ffmpeg 是硬依赖缺了切片和转码全废sudo apt install ffmpeg # Ubuntu/Debian # macOS: brew install ffmpeg # Windows: 把 ffmpeg.exe 和 ffprobe.exe 放到项目根目录最后是预模型仓库里 tools/download_models.py 有现成下载脚本对着这张清单核对是否就位即可文件放置位置用途hubert_base.ptassets/hubert/内容特征提取pretrained、pretrained_v2assets/ 下训练底模v2 需额外下载uvr5_weightsassets/uvr5_weights/人声伴奏分离rmvpe.pt项目根目录RMVPE 音高提取macOS 用户有偷懒路线直接sh ./run.sh装依赖IPEX 的 I 卡用户启动前记得先 source Intel oneapi 的 setvars.sh。启动 WebUI 后第一次训练的点击顺序python infer-web.pypoetry 装的依赖就写成poetry run python infer-web.py。浏览器打开 WebUI 后别先进模型推理第一次直接走训练页签填实验名如 my-voice采样率选 40k版本选 v2要拿去唱歌就保持带音高为是纯语音可以不要。把十几分钟录音放进一个单独文件夹step2 填这个路径点处理数据它会自动切片和归一化。点特征提取音高算法保持默认 rmvpe 即可。点一键训练——它会把处理数据、特征提取、训练模型、建索引四步连起来跑默认 20 个 epoch。切到模型推理页签选刚出的 .pth 和 added 索引传一句干声点推理试听。⚠️ 报 ffmpeg error 或 utf8 error九成是路径的锅音频路径带空格、括号或训练集文件夹名含中文。先改路径再怀疑软件。⚠️ 日志显示 Training is done 但推理页找不到 added 开头的索引文件是索引那一步卡住了回训练页签再点一次训练特征索引就好。想再抠效果的话v1 和 v2 底模可以在训练页签的版本项里切换、重训对比ckpt处理页签支持模型融合把两个音色按权重混出中间值Onnx 导出则面向实时变声场景配合 tools/rvc_for_realtime.py 走低延迟链路。手机里那十几分钟录音现在够你交付一个能用的音色了。建议的下一步拿同一批数据把 epoch 从 20 拉到 40 各训一次对比听感差异——参数上的微调常常比换底模更值。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考