Insanely Fast Whisper 语音转文字模型选型速查:3分钟定下 large-v3 与 distil-large-v2
Insanely Fast Whisper 语音转文字模型选型速查3分钟定下 large-v3 与 distil-large-v2【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisperInsanely Fast Whisper 是一个基于 Whisper 的本地语音转文字命令行工具默认模型 large-v3 与蒸馏版 distil-large-v2 在速度和显存占用上差别明显。本文直接引用项目官方 A100 基准数据做模型选型速查读完 3 分钟你就能定下该用哪一个。2.5 小时音频跑了 31 分钟时间都去哪了第一次跑语音转写的人常会卡在同一件事上150 分钟的音频转完默认配置要等约 31 分钟小显存显卡更早报 OOM。项目里其实有三个候选——large-v3、distil-large-v2 和 faster-whisper large-v2选错配置等待时间差 6 倍以上。一张表看懂三个选项的核心差异维度large-v3默认distil-large-v2faster-whisper large-v2基线定位OpenAI 多语言旗舰版蒸馏轻量版C 推理引擎实现下载体积3.09G小于 large-v33.09G转 150 分钟音频A1001 分 38 秒FP16FA21 分 18 秒FP16FA28 分 15 秒8bit未优化时基线31 分 1 秒FP323 分 16 秒FP16BT9 分 23 秒FP16显存压力较高较低较低典型用途多语言、精度敏感速度优先、硬件吃紧示例 notebook 对照一句话结论同为 Transformers 路线的两个选项拉开优化后差距很小distil 的显存压力更低faster-whisper 只出现在 notebooks/ 的基准对照里不是 CLI 的运行选项。按场景拆速度、显存、精度分别怎么选表里的差距主要来自三个场景逐个拆开看。 批量转写提速distil 略快结论只拼吞吐distil-large-v2 更快。依据是 README.md 在 NVIDIA A100 80GB 上的基准同样的 FP16 批量 24 Flash Attention 2 配置下distil 转完 150 分钟音频用 1 分 18 秒large-v3 用 1 分 38 秒而 faster-whisper large-v2 即使用 8bit 也要 8 分 15 秒。排队处理大量音频时选 distil整体耗时还能再砍掉约两成。 显存吃紧Mac 和小显存卡结论distil 更容易跑得动。large-v3 单个权重文件就有 3.09Ginsanely_fast_whisper_colab.ipynb 的下载日志可以佐证README 的 FAQ 也提醒Mac 的 mps 后端更吃内存通常要把--batch-size降到 4约占 12GB。如果你频繁 OOM先降 batch再考虑换 distil。 精度与多语言large-v3仓库只给了速度基准、没给精度对比这里按模型定位判断large-v3 是 OpenAI 最新的多语言旗舰CLI 为它保留了完整的--task transcribe/translate与--language参数见 src/insanely_fast_whisper/cli.pydistil 是蒸馏出的轻量版。音频里混着外语、专业术语或噪声较大时large-v3 是更稳的选择。选谁直接给答案显存 24G、单条音频要高精度→ 默认 large-v3加--flash True开 Flash Attention 2。Mac 或小显存卡、经常 OOM→--device-id mps --batch-size 4还放不下就换 distil。大批量、拼速度→ distil--model-name distil-whisper/large-v2。需要把外语翻译成中文→ 只有 large-v3 支持--task translate。最小可跑步骤从克隆到第一条转写克隆项目里面有示例 notebook 和完整文档git clone https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper安装 CLIREADME 锁定的版本是 0.0.15pipx install insanely-fast-whisper0.0.15 --force运行一条体现关键差异的命令——加--model-name切到 distil省略则默认 large-v3insanely-fast-whisper --model-name distil-whisper/large-v2 --file-name 音频路径或URL一句话收口选型逻辑就一句精度和多语言找 large-v3速度和低显存找 distil。所有参数的默认值与说明见 README.md 的 CLI Options 一节想手工搭推理流程可以看 notebooks/ 里的两个示例。【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考