RVC WebUI 声音克隆:十分钟录音做出自己的变声器

📅 发布时间:2026/9/20 14:04:33
RVC WebUI 声音克隆:十分钟录音做出自己的变声器
RVC WebUI 声音克隆十分钟录音做出自己的变声器【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI老式变声器出来的声音电子味重想调出像样的效果往往要录几个小时的素材还未必像。RVC WebUI 声音克隆提供了另一条路它是 MIT 协议的免费开源工具用 10 分钟低底噪录音就能训练出一个可使用的语音转换VC模型既能离线给歌曲换人声音色也能在直播、通话里实时变声。入门级独立显卡即可跑没有 N 卡也有 CPU 或 DirectML 的可用方案。下面按一条完整的声音克隆入门教程流程走一遍。小数据量与低显存门槛它比传统变声器好在哪传统变声器的原理是移调加效果器结果像机器人而且根本不像目标人物。RVC 的做法是先把声音拆成内容与音色两类特征再用检索机制把输出音色替换成训练集音色——项目名里的 Retrieval-based 指的就是这个。它用 top1 检索替换源特征输出音色贴近训练对象同时避免训练集音色泄漏到结果里。对照一下以前的麻烦以前的麻烦RVC WebUI 的处理方式录音几小时还未必出效果约 10 分钟低底噪录音即可完成一轮训练数据质量决定上限输出电子味重不像目标人声检索式特征替换输出音色向训练集靠拢并抑制音色泄漏训练、推理都要高端显卡4G 显存可完成推理AMD/Intel 卡可走 CPU 或 DirectML 路线实时变声依赖专用硬件端到端延迟约 170ms搭配 ASIO 声卡可降至约 90ms官方 README 给出的实测口径数据量方面FAQ 建议 10–50 分钟音色有特色且底噪低时5–10 分钟也能见效。十分钟跑通从装依赖到听到结果准备 Python 3.12 环境与依赖该分支面向 Python 3.12 x64Ubuntu 用户建议 24.04。克隆仓库并建虚拟环境git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv激活虚拟环境后按硬件选依赖文件安装。N 卡先装对应 CUDA 版本的 Torch再装requirments_cu118_py312.txtRTX 50 系用 cu128 版CPU、AMD、Intel 直接装 CPU 版python -m pip install -r requirments_cpu_py312.txt完成标志python -c import torch无报错且输出的 CUDA 状态与你的硬件匹配。下载底模到 assets 目录仓库本身不含底模需要按 README 的目录结构放到assets/下hubert_base/和rmvpe/是推理必需训练还要加pretrained/与pretrained_v2/。README 里给出了基于 huggingface_hub 的下载命令照抄执行即可也可以手工下载后按路径摆放。Windows 用户另需把 ffmpeg.exe、ffprobe.exe 放到项目根目录Ubuntu 前面装系统依赖时已一并装好。启动训练界面python webui.py浏览器会自动打开界面默认端口 7865无桌面的服务器加--noautoopen后手动访问。跑一次完整流程并验证把 10 分钟以上的目标人声录音放入训练集目录要求底噪低。界面上填实验名音高提取选默认的 RMVPE——它是项目默认项速度快、占显存少然后一键执行数据集处理和模型训练。训练完切到推理页选中新模型与对应索引上传一段没参与训练的人声作为输入生成结果。验证标准就一条输出听起来是“目标音色 原句的旋律和节奏”。控制台无报错、音色方向对了这次训练就算成功。场景深讲直播实时变声要调哪几个参数适合谁主播、K 歌用户以及任何想用另一种声音通话的人。怎么用运行python realtime_gui.pyWindows 双击 go-realtime_gui.bat选输入输出设备和模型即可开始说话。端到端延迟约 170ms声卡支持 ASIO 时能压到约 90ms。调哪里音高提取方式实时场景选 RMVPE速度和准确性最稳pm 更快但精度低一些。音调升降想整体变高或变低在音调参数上调即时生效。index_rate控制输出向训练音色的贴近程度。不像目标就调高出现浑浊感就调低它到 1 时理论上完全消除推理源音色泄漏但音质会更偏向训练集。给歌曲的人声换音色分离加转换两步走适合谁想做歌曲人声翻唱版、给播客或配音换音色的人。怎么用原曲是人声加伴奏的混合体第一步先分离。界面内置 UVR5 人声分离输入原曲导出纯人声第二步把干声送进推理页转换。两步都在界面内完成不需要手写脚本。调哪里分离出的干声如果带噪或带残响先回 UVR5 页换分离模型再处理别急着怪转换模型。批量处理多首文件时先把一首文件的分离、推理流程调通再复制流程命令行方式在 FAQ Q7 有说明WebUI 消息窗也会打印对应的数据集处理和训练命令。把训练好的音色分享给别人适合谁想把模型给朋友用或换设备继续用同一个音色的人。怎么用注意logs/实验名/下的 pth 是实验状态快照供复现和续训不是拿来分享的可分享的是assets/weights/下 60MB 以上的那个 pth且要连同对应的 .index 文件一起打包。验证方式对方设备上把 pth 放入assets/weights/、index 放入assets/indices/刷新音色列表能选中并正常推理即打包无误。避坑手册四个高频问题报 ffmpeg error 或 utf8 error症状加载训练集时报 ffmpeg 或 utf8 相关错误。可能原因大概率不是 ffmpeg 本身而是路径带空格、括号等特殊符号或训练集路径含中文。对策把训练集挪到纯英文且无空格的路径项目目录本身也建议放在英文路径下。显存溢出 CUDA out of memory症状训练或推理时显存不足崩溃。可能原因显存不够4G 以下显存基本无解4G 是可用下限。对策训练时缩小 batch size推理时缩小 configs/config.py 末尾的 x_pad、x_query、x_center、x_max程序对低显存卡也会自动切到更小配置——低显存语音转换能做的优化主要就在这两处。输出音色不像目标症状训练完成但声音介于自己和目标之间甚至偏向底模音色。可能原因这叫音色泄漏当推理源或底模音质高于训练集时输出音质被带高、音色被带偏。对策调高 index_rate若训练集音质好、时长足则优先调高 total_epochFAQ 的口径是低质数据 20–30 足够高质数据可到 200模型本身就不会太依赖检索混色。一键训练后没有索引或界面报 Connection Error症状控制台显示训练完成但没生成 added 开头的索引文件或浏览器显示 Connection Error / Expecting value。可能原因训练集过大时索引步骤卡住连接错误通常是控制台窗口被关了或系统代理干扰了本地访问。对策再点一次训练索引按钮保持控制台窗口开着关闭全局或局域网代理。下一步与求助入口跑通主线之后值得按顺序做三件事再收集 10 分钟数据换新实验名续训音色会持续贴近用 ckpt 选项卡里的 ckpt-merge 融合两个模型换一种更稳的音色方向最后切到实时界面在真实对话里检验延迟和听感。卡住时优先查仓库内置文档docs/cn/faq.md 覆盖路径、显存、模型分享等高频问题docs/cn/Changelog_CN.md 记录各版本改动。界面文案的多语言翻译文件在i18n/locale/下改界面措辞可以从那里入手。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考