国产开源语音模型大乱斗:Qwen3TTS、IndexTTS、dots.TTS、AuK 四家对打,谁最能打?

📅 发布时间:2026/10/10 0:07:59
国产开源语音模型大乱斗:Qwen3TTS、IndexTTS、dots.TTS、AuK 四家对打,谁最能打?
国产开源语音模型大乱斗Qwen3TTS、IndexTTS、dots.TTS、AuK 四家对打谁最能打【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK2026 年国产开源语音赛道进入贴身肉搏阶段阿里 Qwen 团队发布 Qwen3-TTS 系列哔哩哔哩把 IndexTTS 迭代到 2.5小红书亮出 dots.TTS腾讯混元则端出一款 1.5B 的语音基础模型 AuK。四家几乎同期开源、同期刷榜把零样本克隆、指令式语音编辑、多语言流式合成这些原本分散在商业 API 里的能力一次性摊开在开发者面前。本文基于四个项目的公开仓库与社区实测情报重点拆解后来者 AuK 的源码级实现回答一个实际问题它们到底在拼什么谁又更适合哪类工程场景。一、四家模型的参数规模与定位差异先把四家的身板摆上桌。这是社区对四家最直观的认知分歧点同为开源语音模型参数规模与产品定位其实完全不在一个赛道。模型出品方参数规模核心定位开源协议Qwen3-TTS阿里 Qwen 团队0.6B / 1.7B 两档端到端语音生成全家桶克隆、语音设计、流式合成Apache-2.0IndexTTS 2 / 2.5哔哩哔哩约 0.8B零样本克隆 精细可控情绪/语速/发音B 站自研许可dots.TTS小红书公开资料较少社区新面孔作为对照组观察待确认AuK腾讯混元1.5B 主干 3B 编码器语音生成与编辑基础模型任务面最宽MITQwen3-TTS 的差异化在于架构换代它放弃主流语义 token DiT 声码器三段式改用自研 Qwen3-TTS-Tokenizer-12Hz 的离散多码本 LM 架构一条链路走完端到端建模宣称绕开了 LMDiT 的信息瓶颈与级联误差。0.6B 与 1.7B 两档对应不同显存预算且全系列支持流式首个音频包可在输入单个字符后立刻输出端到端时延低至 97ms这是四家里唯一把实时交互写进卖点的。IndexTTS 走的是另一条路线自回归 BigVGAN 类声码器把可控性做到极致。2.5 版支持中英日西阿五种语言语速可通过duration_factor在 0.5x–2.0x 之间调节还提供中文拼音、英文 CMU 音素、日文假名的发音级控制——社区对它的普遍评价是2.0 更稳2.5 更快、语言更多。AuK 则刻意不把自己叫 TTS。按仓库自述它是 1.5B 的speech generation and editing 基础模型在数千万小时音频上训练通过统一的自然语言指令接口同时承载零样本/指令 TTS、内容编辑、声学编辑、副语言编辑、增强与分离五大类任务。换句话说前两家在合成得更像、更快AuK 的目标是一模型接管从生成到后期加工的全链路。二、AuK 的架构拆解一条指令走遍十六种任务要理解 AuK 与 TTS 专精模型的分野得先看它的骨架。仓库根目录的 config.yaml 把关键组件写得明明白白主干backbone: Flux2Editcfm_class: CFMEdit即双流 MMDiT 条件流匹配CFM的扩散 Transformer10 层 dense 20 层 single-layerhidden dim 1536、24 头指令编码器text_encoder_path: ckpts/Qwen2.5-Omni-3B直接外挂 3B 的多模态大模型负责把自然语言指令与参考音频编码成交叉注意力条件声码器vae_name: BigVGANFlowVAE48 倍下采样、24kHz 输出配置里的 upsample/downsample 级联与 resblock 参数全部继承自 BigVGAN 家族。这条链路最反直觉的设计是扩散主干只有 1.5B而给它传话的 MLLM 编码器是 3B。代价是显存门槛——社区实测同样指出需要配合 3B Qwen2.5-Omni 编码器运行对显存要求较高。这也是 AuK 部署成本争议的来源后面会细说。架构的完整图示见仓库的 assets/arch.pngQwen2.5-Omni 编码器接收文本指令 参考音频输出语义表征进入 Flux2Edit 扩散主干与 AuK-VAE 提取的声学 latent 在流匹配时间步上融合最终经 BigVGANFlow 声码器还原波形。任务路由、人评 DPO 与 Flow-GRPO 后训练共同决定了一条指令能撬动多少任务。任务的宽度是 AuK 最硬的底牌。按 README.md 的 Supported Tasks 表16 种任务全部走同一个 message-based 接口例如零样本/指令 TTS给参考音频 一句用同样的声音说……或者完全不给音频用一句话描述音色直接合成内容编辑替换/插入/删除语音中的词句甚至改写歌声歌词Lyric Editing声学编辑按半音升降调、按倍率变速、按分贝调音量副语言编辑改情绪、改音色、去口音、去/加呼吸笑声、正常语与耳语互转增强与分离去噪去混响、按说话顺序分离、人声伴奏分离、按说了什么提取目标说话人。关键差异在于IndexTTS 的可控是几个预设旋钮情绪参考音频、语速系数、音素标注而 AuK 的可控是开放的自然语言命题——你不需要知道该调哪个参数只要把诉求写成一句话。仓库 README 里给了一个典型例子指令是请将这段音频恢复成纯净人声版本保留原本所有说话人并去除其中的噪声和混响输出等长的纯净语音一行 CLI 即完成去噪任务auk-infer \ --audio assets/demo-input-audio/vocal-extraction/vocal-1-input.wav \ --instruction 请将这段音频恢复成纯净人声版本保留原本所有说话人并去除其中的噪声和混响输出等长的纯净语音。 \ --output out_denoise.wav三、克隆稳定性、编辑能力、部署成本逐项对比3.1 克隆稳定性单音频克隆已是及格线拼的是快和少数据三家有可比数据的产品在零样本克隆上都能做到一段参考音频 一句指令复刻任意音色。Qwen3-TTS 把克隆压缩到 3 秒参考音频并支持x_vector_only_mode只取说话人嵌入代价是克隆保真度下降IndexTTS 的看家本领是音色与情绪的解耦——用独立的情绪参考音频或 8 维情绪向量控制表达克隆声音本身则保持稳定AuK 则把克隆隐含在统一接口里参考音频与文本指令一起进编码器靠 MLLM 的语义理解完成音色迁移。从基准数据看IndexTTS 在 CV3-Eval 零样本 TTS 上IndexTTS2.5-RL 版本平均 WER 6.00、说话人相似度 73.63属于开源第一梯队Qwen3-TTS 的 12Hz-1.7B-Base 在 Seed-TTS 测试集中文 WER 0.77、英文 1.24内容一致性表现突出。AuK 则在 Seed-TTS-Eval 等编辑类基准上领先但社区技术报告拆读给出的情绪编辑成功率仅 9.94%——克隆和 TTS 是强项情绪编辑仍是短板。3.2 编辑能力这是 AuK 的主场也是唯一的全栈选手四家里只有 AuK 把编辑作为第一性功能内容增删改、歌词改写、升降调、变速、调音量、情绪/音色/口音改造、去非语言声、耳语互转、去噪、分离、目标说话人提取——全部一条指令完成。仓库 README 的内容编辑示例非常直观auk-infer \ --audio assets/demo-input-audio/content-edit/content.wav \ --instruction Replace but accepting what we cannot have with and living well with dreams unmet. \ --output out_content_edit.wav \ --gen_seconds 7.0这条命令的工程意义在于替换台词后保留原音色、语速与韵律这正是播客剪辑、影视配音、有声书修音最需要的无损局部重录。社区已有教程验证了 AuK 的中文语音内容编辑场景精准替换、插入、删除、歌词改写。相比之下IndexTTS 的编辑能力本质是用参数重新生成Qwen3-TTS 尚未把编辑列为核心能力——在编辑这个维度上AuK 目前没有同量级对手。需要泼冷水的是 AuK 当前的两个已知限制30 秒音频长度上限源码级限制ComfyUI 集成文档亦明确 30 秒 sourcetarget 序列限制和情绪编辑成功率偏低。对长音频工程这是一个绕不开的硬约束。3.3 部署成本AuK 门槛最高但优化动作也最密这是四家差距最大的一项。AuK 因为外挂 3B 编码器完整部署的显存账单明显高于另两家官方在 A800-SXM4-80GB 上以 bf16 实测纯文本 1.5 秒输出的峰值显存约 24.78 GiB加上 5 秒参考音频约 25.00 GiB。仓库随后给出了三条降本路径CPU offloadauk-infer/auk-gradio加--cpu_offload峰值显存降至约 16.75 GiB省下约 8 GiB约 32%编码器瘦身社区 PR 将编码器内存占用削减约 7.5 GiB消费级 GPU 本地推理的可行性明显提升AuK-Flash蒸馏变体固定 4 步采样且无需 CFG社区拆读称推理提速约 4.5 倍RTF 显著下降。部署形态上AuK 的开局也颇为豪华SGLang-Omni 发布当天Day 0即支持 AuK 与 AuK-FlashvLLM-Omni 提供了单张 H100 的双阶段流水线 recipe另有 audio.cpp 的 GGUF 离线推理与 Apple Silicon 的 MLX 支持分支。社区也流行用 Gradio 与 ComfyUI 做可视化接入pip install -e .[gradio]一键起 Web UIComfyUI 通过 AuK Model Loader AuK Generate/Edit 节点拖拽出流水线。反观对手Qwen3-TTS 因为 12Hz 轻量 tokenizer 非 DiT 架构单卡推理压力小且qwen-ttsPyPI 包开箱即用、vLLM-Omni 离线推理官方示例齐全IndexTTS 2.5 在 RTX 4090 上 bf16 的 RTF 约 0.19–0.21文本越长越划算显存友好且官方给出 vLLM recipe 用于生产部署。结论很直接论部署门槛AuK Qwen3-TTS ≈ IndexTTS论综合降本手段的丰富度AuK 反超。四、从榜单与社区热度看谁先跑出来先看人气。截至本文写作GitHub 数据是IndexTTS 约 24.4k stars2.9k forks、Qwen3-TTS 约 13.7k stars、AuK 约 1.5k stars。IndexTTS 凭借更早的开源时间和 B 站社区的基本盘遥遥领先这符合社区对其生态最成熟的普遍认知。热度当然不等于能力——AuK 的 1.5k stars 是在发布仅数周内达成的增速并不差。再看背书。AuK 在开源首周就拿到了三个含金量极高的生态位SGLang-Omni 与 vLLM-Omni 的双重 Day-0 支持、被选为ICASSP 2027 Audio Editing Challenge Single Model Track 的端到端基线模型、以及 Awesome-Audio-Editing 语音编辑资源清单的收录。这意味着语音编辑这个细分赛道的规则制定权正在向 AuK 的范式倾斜——用自然语言指令统一生成与编辑而非提供一堆离散参数旋钮。最后看性能图。仓库 assets/performance.png 展示了 AuK 在语音生成、编辑、增强、分离四类基准上的横向对比结果其中编辑类基准如 SpeechEditBench是它拉开差距的主场。综合社区实测与基准数据可以给出一个不带滤镜的结论想要最快最省地批量合成、实时交互选 Qwen3-TTS流式 12Hz 轻 tokenizer 是独门优势想要克隆音色最稳、可控维度最多且生态最成熟选 IndexTTS24k stars 的工程积淀不是白攒的想要一套模型搞定合成 后期编辑 增强分离的全链路现阶段只有 AuK 能接单但要先接受它的显存账单与 30 秒时长限制dots.TTS 作为小红书入局的第一张牌公开细节尚少更多是标志着头部内容平台全部下场的信号意义——四家对打的格局本身比任何单一模型的参数都更有信息量。这场大乱斗的终局判断其实很清晰没有全能冠军只有定位错位。Qwen3-TTS 赢在架构与实时性IndexTTS 赢在可控与生态AuK 赢在任务宽度与编辑范式。对于开发者正确姿势不是选最强而是先回答自己的场景是生成还是编辑——前者看 TTS 榜单后者盯 AuK 的更新节奏。而 AuK 能否把情绪编辑成功率从 9.94% 拉上来、能否解开 30 秒长度枷锁将是它守住编辑赛道定义者地位的下一个观察点。【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考