Buzz 实践:本地 Whisper 离线转录与音频翻译

📅 发布时间:2026/9/7 10:28:21
Buzz 实践:本地 Whisper 离线转录与音频翻译
Buzz 实践本地 Whisper 离线转录与音频翻译【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、播客、网课视频想把语音变成文字多数在线工具要么按量收费要么音频要上传到别人的服务器。Buzz 的做法是把 OpenAI 的 Whisper 模型搬到你自己电脑上音视频文件、YouTube 链接、麦克风录音都能离线转录或翻译成文字导出 TXT、SRT、VTT还能用命令行脚本化批处理。环境要求与安装 Buzz这块只解决一件事装得上、跑得动。Buzz 官方桌面版覆盖 macOSIntel 与 Apple Silicon、Windows、Linux 三个平台从源码或 PyPI 安装需要 Python 3.12 和 ffmpeg。系统macOS / Windows / LinuxPython3.12依赖ffmpeg音频解码必需Linux 或从源码运行时用下面命令装 PyPI 版本并启动pip install buzz-captions python -m buzz启动后应弹出 Buzz 主界面没有桌面环境也可以只跑命令行。验证安装是否成功看版本即可buzz --version输出当前版本号如 1.4.5说明工具链完整。macOS 和 Windows 用户也可以直接下载官方安装包Linux 另支持 Flatpak 与 Snap细节按 docs/docs/installation.md 走即可。图 1Buzz 主界面任务列表集中管理导入文件、麦克风录音等所有转录任务端到端实战把一段 MP3 转成带时间轴字幕最典型的场景是手上有音频或视频文件要拿到文字稿或字幕文件。下面用仓库自带测试音频走一遍完整流程。先确认 Buzz 能识别命令行参数并列出add子命令的全部选项buzz add --help预期看到--tasktranscribe/translate、--model-type、--model-size、--language、--srt/--vtt/--txt等参数说明。仓库里就有一段法语测试音频正好拿来验证转写buzz add --task transcribe \ --model-type whispercpp --model-size small \ --language fr --txt --srt \ -d ./out \ testdata/whisper-french.mp3这一步做了三件事用 whisper.cpp 后端的 small 模型把法语音频转成文字并导出 TXT 和 SRT 两种格式到./out目录。首次运行会自动下载对应大小的 Whisper 模型稍等片刻完成后预期在out/下看到同名.txt和.srt文件SRT 里每句带时间戳可直接导入剪辑软件。打开生成字幕对应的查看器Buzz 会按时间段展示文本支持搜索、播放控制和倍速图 2转录查看器按时间轴展示结果点某一行会跳到对应音频位置把--task换成translate、--language指定源语言如fr同一条命令就变成外语转英文的翻译任务不写--language则自动检测但官方建议尽量显式指定避免检测跑偏。按问题深入选后端、降噪、实时转录长音频跑不动模型和后端怎么选模型越大越准也越慢。tiny 适合快速试跑small 是速度和质量平衡点medium/large 留给对准确率要求高的长音频。--model-type可以切后端whisperPyTorchNvidia GPU 走 CUDA、whispercpp支持 Vulkan核显友好、fasterwhisper、huggingface可指定--hfid用任意兼容模型以及openaiapi调用云端。buzz add --model-type huggingface \ --hfid openai/whisper-small \ --srt ./audio.mp4偏好设置里的模型页可以预置各后端的模型大小运行任务时直接选用不用再敲参数图 3偏好设置中的模型页为不同 Whisper 后端分别选择模型多人或嘈杂录音识别不准环境噪音大、多人抢话时Whisper 容易把背景音也转进去。Buzz 提供了转录前的人声提取--extract-speech基于语音分离模型先抽出人声再转写以及转录完成后的说话人识别把谁在什么时候说了什么标出来buzz add --extract-speech --language zh \ --model-size small --srt ./meeting.mp3预期输出的 SRT 中背景噪音对应的段落明显减少多人会议再配合说话人识别可以按说话人拆分内容。没有音频文件想边说边出字幕Buzz 支持麦克风实时转录结果直接显示在演示窗口适合演讲、庭审记录这类现场场景配合 OpenAI 兼容 API 还能做实时翻译。实时链路对 CPU 占用较高官方也注明它偏准实时而非逐字即时重要场合建议先试跑一次确认本机帧率可接受。生产落地性能与音频质量三条可直接执行的优化建议长音频和批量任务换后端提速--model-type whispercppVulkan/GPU或fasterwhisper比默认 PyTorch 后端省不少时间。重复工作自动化CLI 的add命令加--hide-gui可纯后台跑批GUI 侧的监听文件夹设置可让新丢入的文件自动排队转录。显式指定语言--language固定源语言既快又稳避免自动检测在方言或混合语言上出错。音频质量是最容易被忽略的坑。Buzz 不替你修音频转写前值得先自查两点一是信噪比底噪大的录音先加--extract-speech或在剪辑软件里降噪再喂给 Buzz二是专有名词人名、产品名反复识别错时在高级设置的 Initial prompt 里把这些词列出来Whisper 会倾向于按提示拼写。排查问题时看两处命令行运行会把日志同时打到终端和用户日志目录Linux 一般在~/.local/state/Buzz/logs.txt转写中途卡住先看是否有模型下载失败或 ffmpeg 缺失输出完全为空则检查输入是否被识别为 URL 还是文件路径两者走的是不同导入分支。CLI 全部参数参考 docs/docs/cli.md。速查与延伸场景推荐用法备注文件转文字buzz add --task transcribe --txt首次运行自动下载模型视频配字幕buzz add --srt --vtt时间轴由 Whisper 直接给出外语转英文buzz add --task translate --language fr显式指定源语言更稳长音频提速--model-type whispercpp或fasterwhisper按显卡选 CUDA/Vulkan嘈杂录音追加--extract-speech转写前先做人声分离后台批处理buzz add ... --hide-gui可写进脚本定时执行关键文档安装指南CLI 完整参数常见问题 FAQBuzz 把音频变文字从云端服务搬回了本地机器代价是模型下载和首次运行的等待时间。下一步建议先用仓库里的testdata/音频跑通一条buzz add确认输出目录的 SRT 能正常播放再换成自己的真实录音从 tiny 起步逐级调大模型直到准确率和耗时达到你的平衡点。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考