5分钟上手:把EPUB变成有声书的语音克隆指南

📅 发布时间:2026/9/7 19:09:10
5分钟上手:把EPUB变成有声书的语音克隆指南
5分钟上手把EPUB变成有声书的语音克隆指南【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook你可能遇到过这种情况电子书阅读器里躺着一堆 EPUB可通勤、锻炼的时间翻不动书市售有声书又覆盖不全你想读的书。ebook2audiobook下文简称 E2A就是为这个需求做的它把电子书通过语音合成也就是把文字变成音频生成带章节结构的有声书并支持语音克隆和 1158 种语言。 跑起来3步完成首次转换最快路径是本地 Web 界面一共 3 步。获取项目git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook运行启动脚本macOS/Linux 在终端执行./ebook2audiobook.commandWindows 双击ebook2audiobook.cmd。脚本会自动安装运行环境你不用手动配 Python 依赖。浏览器会自动打开 http://localhost:7860 界面上传一本电子书、点 Convert第一次转换就完成了。如果安装报错或页面打不开可以直接跳到文末 FAQ 查对应解法。它能做什么跑起来之后再看几个真正拉开差距的能力。语音克隆上传一段简短清晰的录音合成出的声音就会接近这个人。比如录 1 分钟自己朗读的音频之后整本书都可以用你的声音来读录音里有背景音乐或噪音也没关系E2A 会自动清理。OCR 文本识别扫描版 PDF 或整页是图片的书文字复制不出来内置 OCR 能直接从图片里识别出文字再合成语音。上图是一张扫描书页E2A 识别其中的英文文字后可以整页转成音频。SML 标签控制SML 是 E2A 内置的简单标记语言用来精细控制停顿和换声[break]表示 0.3–0.6 秒短停顿[pause:3]表示固定 3 秒停顿[voice:/路径/voice.wav]...[/voice]可以在朗读中途切换到另一个声音。批量转换多本书一次转完用命令行模式直接转换整个目录./ebook2audiobook.command --headless --ebooks_dir ./my_books --language eng--language使用三位语言码比如 eng 是英语、fra 是法语Windows 下把脚本名换成ebook2audiobook.cmd即可。界面与操作流程界面就两个标签页Input Options 和 Audio Generation Preferences按顺序操作 3 步即可。第一张图里把 EPUB 拖进左上角 EBook File 区域在 Processor Unit 选 CPU 或 GPULanguage 下拉框确认书籍语言默认 English 不用改想做语音克隆就在右侧 Cloning Voice 上传语音文件。第二张图是参数滑杆Temperature创造性、Speed语速、Repetition Penalty重复惩罚等。全部保持默认就能跑不用逐项研究等听到效果不对劲再回来调。第三张图里点 Convert 转换完成后先在 Listen 播放器里试听再从下方 Download 区下载 m4b 文件。m4b 格式支持章节标记适合在播放器里按章收听长书。调优指南如果第一次转换的结果你听着可以接受默认值就够了想让声音更自然重点看这几个参数参数作用推荐值适用场景Temperature温度语音创造性越高越活泼0.7–0.9叙事 0.7 左右对白多可到 1.0Repetition Penalty重复惩罚抑制同一短语反复出现2.0–2.5文本里重复词句较多时Speed语速朗读快慢0.8–1.01.0 自然0.8 更舒缓Top-k选词范围越低越稳定50降低可加快生成速度Text Splitting文本分割长文本切段再合成开启长篇小说建议必开经验之谈叙事类内容温度调到 0.7–0.8 最自然嫌快嫌慢只动 Speed 一项别同时改多个参数不好定位问题。部署与硬件硬件要求不高最低2GB 内存、1GB 显存推荐8GB 内存、4GB 显存。项目支持 Windows、macOS、Linux 三大系统包括 Apple Silicon 和 ARM 架构。不想折腾本地环境的话有现成的 Docker 镜像用DEVICE_TAGcu128 docker compose --profile gpu up就能拉起 GPU 版。适合谁用适合想在通勤和运动时间听书的人、给视障朋友做阅读辅助的人、需要给播客或视频配旁白的人。常见问题QGPU 没被检测到怎么办A先用 CPU 模式跑通整个流程再检查显卡驱动和 CUDA 版本依赖问题太麻烦时直接改用 Docker 镜像。QCPU 模式转换太慢怎么办ACPU 跑高品质引擎确实慢改用 YourTTS、Tacotron2 这类轻量引擎提速或者切到 GPU 模式。Q语音克隆样本带噪音怎么办A直接上传即可E2A 会自动去除背景噪音再提取声音特征不需要你提前做降噪。QEPUB 里不想要的前言、注释被读出来了怎么办AEPUB 没有统一的章节结构标准转换前用编辑器手动删掉不需要的段落。开始你的第一次转换打开浏览器访问 http://localhost:7860 就能开始第一次转换。完整参数说明和格式列表见项目内的这几份文件README.md安装、使用与故障排查lib/conf.py默认输出格式、设备与路径设置lib/conf_models.py支持的语音合成引擎与模型列表【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考