在本地跑起 Bark:让一段文字在你的机器上变成声音

📅 发布时间:2026/9/1 8:49:58
在本地跑起 Bark:让一段文字在你的机器上变成声音
在本地跑起 Bark让一段文字在你的机器上变成声音【免费下载链接】bark Text-Prompted Generative Audio Model项目地址: https://gitcode.com/GitHub_Trending/ba/bark想在不用 API 的情况下做文本生成音频Bark 是个常见的选择——它是 Suno 开源的生成式模型输入一段文字能产出多语言语音还能顺带生成笑声、音乐和音效。本文按先验证、再选机器的顺序讲跨平台部署覆盖独显、纯 CPU 和 Apple 芯片三类环境以及几个真实的报错和绕法。 安装三步拿到第一句语音先用 Python 3.8 以上的虚拟环境装。源码本身不大但首次运行会从 Hugging Face 自动下载几个 GB 的模型权重建议先确认磁盘空间。git clone https://gitcode.com/GitHub_Trending/ba/bark cd bark python3 -m venv .venv source .venv/bin/activate pip install .Windows 上激活命令换成.venv\Scripts\activate即可。装完直接跑一条命令验证成功后当前目录会出现demo.wavpython -m bark --text Hello, this is bark speaking. --output_filename demo.wav第一次运行会慢进度条走完就是在下载模型耐心等即可。能听到这句hello说明环境已经通了。️ 按硬件分三条部署路径听到第一句话之后可以按机器情况决定后面怎么跑下面三种情况基本覆盖了绝大多数场景。12GB 以上显存的 GPU默认用完整版完整模型需要约 12GB 显存才能全部驻留在 GPU 上。如果你有 3090、4090 这一档的卡什么都不用配直接跑就是最快的。无 GPU 服务器的 CPU 部署小模型 卸载纯 CPU 环境也能跑但要靠两个开关控制内存占用SUNO_USE_SMALL_MODELS换用小一号的模型质量略降但显存需求降到 8GB 左右SUNO_OFFLOAD_CPU把中间张量挪到系统内存让 2GB 显存的卡甚至纯 CPU 都能跑起来。export SUNO_USE_SMALL_MODELSTrue export SUNO_OFFLOAD_CPUTrue纯 CPU 的更多参数组合可以参考 notebooks/use_small_models_on_cpu.ipynb。Apple 芯片的 macOS 部署MPS 可用注意内存比例Apple Silicon 走 PyTorch 的 MPS 后端不需要装 CUDA装普通版 torch 就行。如果生成时报内存错误加一个环境变量通常就能解决export PYTORCH_MPS_HIGH_WATERMARK_RATIO0.0⚖️ 显存与速度的取舍两个开关怎么组合上面的开关可以按需求组合大致是这样配置显存需求速度适合谁默认配置约 12GB最快高端独显开SUNO_USE_SMALL_MODELS约 8GB略慢8GB 显存的卡再加SUNO_OFFLOAD_CPU2GB 以上最慢低显存卡、CPU追求速度就别动开关只求能跑就两个都开。 踩坑实录4 个高频报错下面是几个常见问题的排查思路每条按现象 → 原因 → 解法来看。装错包。现象pip install bark之后导入报错或 API 对不上。原因PyPI 上的bark是另一个同名包并非 Suno 维护。解法始终用前文的源码方式安装。GPU 显存爆掉。现象torch.cuda.OutOfMemoryError: CUDA out of memory原因完整模型放不进显存。解法按上一节设置两个环境变量后重试。 3.Apple 芯片 OOM。现象mps backend out of memory。原因MPS 默认内存水位对生成类任务偏紧。解法导出PYTORCH_MPS_HIGH_WATERMARK_RATIO0.0再跑。 4.模型下载失败。现象huggingface_hub.utils._errors.RepositoryNotFoundError或下载卡在半路。原因默认缓存目录空间不足或网络受限。解法把缓存指到空间大的分区export HF_HOME/data/disk2/.cache/huggingface 选音色与生成更长的音频跑通之后可以进一步榨取它的潜力。Bark 自带 100 多个音色预设覆盖中、英、日、韩等 13 种语言把预设名传给history_prompt音色和语气就会跟着它走文件都在 bark/assets/prompts/ 下v1 与 v2 的差别见里面的 readmefrom bark import generate_audio audio generate_audio(你好这是一次演示。, history_promptv2/zh_speaker_1)默认单次生成约 13 秒的音频更长的内容建议按 notebooks/long_form_generation.ipynb 里的分段策略来想弄清架构和参数细节可以读一下 model-card.md。 卡住了去哪里求助到这里部署就算完成了独显机器保持默认CPU 加两个开关Apple 芯片盯一下 MPS 内存比例。后续再遇到问题可以去项目的 Discord 社区提问或在仓库里检索、提交 Issue——贴报错时建议把完整堆栈带上能帮别人更快定位。【免费下载链接】bark Text-Prompted Generative Audio Model项目地址: https://gitcode.com/GitHub_Trending/ba/bark创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考