「给我 5 秒钟你的声音,我还你一整段朗读」——放在 2020 年,这是论文里才有的事;放在今天,pip install 一行命令就能在本地跑起来。零样本音色克隆(zero-shot voice cloning)已经不是某几个实验室的独门绝技,而是开源 TTS 的标配能力。本文基于 2026-10-07 前后对 GitHub 各仓库现状的核对(star 数、许可证、版本号均以此时间点为准),梳理这条赛道到底卷成了什么样。
三代技术路线:克隆为什么成了标配
TTS 的技术底座大致走过三代:
- 拼接合成:预先录制大量真人语音,按单元(音素/双音子)检索拼接。自然度高,但录音库定了音色,换人就等于重录,谈不上「克隆」。
- 参数式与自回归神经网络:Tacotron、FastSpeech 等把文本映射成声学特征,WaveNet/Hifi-GAN 等声码器还原波形;自回归模型逐帧生成,音质飞跃,但训练一个「说话人」仍要配对数据精调。
- LLM 骨架 + 扩散/流匹配:这一代有两个分支。一条是 audio codec 离散 token + 自回归(VALL-E 一脉):把语音压成离散 token,语音生成变成「语言建模式续写」,GPT-SoVITS、Fish Speech、IndexTTS 都带这条骨架;另一条是 扩散/流匹配(flow matching),用极少步数的并行去噪直接回归语音,代表是 F5-TTS;CosyVoice 则是 LLM 骨架与流匹配声码的混合体。
零样本克隆之所以成为标配,是三件事叠加的结果:大规模「野生」数据(如训练 F5-TTS 的 Emilia 中英数据集)让模型见过足够多的说话人;codec token 把「模仿音色」退化成「给上文续写下文」,几秒参考音频就够了;流匹配把生成速度拉进实时,能力才真正可用。
项目盘点(截至 2026-10-07)
按 GitHub 现状核对,挑六个主力加两位「前辈」:
GPT-SoVITS(RVC-Boss) — 62.4k star,MIT 许可证,是 star 数最高的一档。机制一句话:LLM 骨架自回归 + so-vits 声码,5 秒参考音频零样本合成,1 分钟数据微调即可显著提升相似度。最新 V5 版强化了免微调的音色相似度并更换声码器。中文(含粤语)、英、日、韩五语种;官方给出 v2ProPlus 在 4060Ti 上 RTF 约 0.028。WebUI 把人声分离、切分、ASR 标注、微调打包成一条龙,中文社区生态最成熟。代码 MIT,是少数「整体可商用」的选择(自训练的音色数据自担授权责任)。
CosyVoice(FunAudioLLM,阿里通义系) — 23.9k star,Apache-2.0。最新的 Fun-CosyVoice 3.0(0.5B,2512 版)覆盖 9 种语言外加 18 种以上中文方言口音,支持双向流式(官方称最低 150ms 延迟)与跨语种零样本克隆,RL 版在 test-zh 上 CER 0.81。指令控制韵律与情感是它的招牌,中文自然度长期处于第一梯队。
F5-TTS(SWivid) — 15.3k star,代码 MIT、预训练权重 CC-BY-NC(因训练用了 in-the-wild 的 Emilia 数据集,权重不可商用,官方 README 已致歉说明)。机制是纯流匹配 + DiT,中英双语,v1 基模 2025-03 发布;官方基准在 L20 上配合 TensorRT-LLM 与 Vocos 声码 RTF 0.0394。装起来最省事,pip install f5-tts 即用,另有 f5-tts-mlx 支持 Apple Silicon。
Fish Speech / Fish Audio(fishaudio) — 33k star。最新模型已演进到 S2 Pro(4B 参数),10–30 秒参考音频免微调克隆,以内联情绪标签著称——官方称支持 15000+ 种标签(如 [excited]、[whisper]),覆盖 80+ 语言(中文为一级语言),Dual-AR 架构并用 GRPO 做强化对齐。注意许可证:现行代码与权重均按 Fish Audio Research License 发布,明确非商用且声明对违规追责(早期 1.5 / S1-mini 权重为 CC-BY-NC-SA 4.0),商用需另行洽谈。
IndexTTS(index-tts,B站) — 24.3k star,bilibili 模型使用许可(自定义协议,商用需联系官方)。IndexTTS-2.5(2026-08 发布,0.8B)支持中英日西阿五语,主打「音色与情感解耦」:8 维情绪向量 + 情绪文本(2.5 走 Qwen 辅助),2.5 起语速 0.5–2.0 倍可调,还能用拼音/CMU 音素/假名修正多音字发音——对中文播客与有声书是实打实的刚需。4090 bf16 下 RTF 约 0.21。
Kokoro(hexgrad) — 9.2k star,Apache-2.0(代码与权重均如此),仅 82M 参数,架构源自 StyleTTS 2。9 种语言含中文(G2P 需装 misaki[zh]),CPU 即可实时,24kHz 输出。它不做音色克隆,胜在部署门槛与法律确定性——很多生产环境选它就是冲着「商用零顾虑」。
两位前辈:Coqui 的 XTTS-v2(仓库 46.1k star,代码 MPL-2.0,模型权重 CPML 限制商用)曾是跨语种克隆的事实标准,但 Coqui 公司已于 2024 年初停运,仓库不再维护,选型时应把它当历史选项;ChatTTS(2noise,39.9k star,代码 AGPLv3+、开源权重 CC BY-NC 4.0)以 [laugh]、[uv_break] 等韵律 token 见长,有趣的是它在训练时故意混入少量高频噪声并做 MP3 压缩,主动给克隆滥用设障——这是开源项目内置合规措施的典型样本。
垂直对比
| 项目 | 机制 | 音色克隆 | 中文效果 | 速度(RTF,官方口径) | 许可证(商用) | 适合场景 |
|---|---|---|---|---|---|---|
| GPT-SoVITS | LLM 骨架 + so-vits 声码 | 5s 零样本 / 1min 微调 | 强(含粤语),社区生态最全 | 0.028(4060Ti,v2ProPlus) | MIT,整体可商用 | 配音、数字人、本地全流程 |
| CosyVoice 3 | LLM 骨架 + 流匹配声码 | 3s 级零样本、跨语种 | 强,18+ 方言口音 | 流式最低约 150ms 首包 | Apache-2.0 | 客服/语音助手、方言需求 |
| F5-TTS | 纯流匹配 + DiT | 数秒零样本 | 良好,偶有吞字反馈 | 0.0394(L20 + TRT-LLM) | 代码 MIT / 权重 CC-BY-NC | 快速上手、二开训练自有权重 |
| Fish Speech / S2 | Dual-AR codec LM | 10–30s 免微调 | 良好(一级语言) | 未见官方公开口径 | Research License,非商用 | 多语言、强情绪标签控制 |
| IndexTTS-2.5 | 自回归 + 时长控制 | 单参考克隆、音色情感解耦 | 强,拼音纠音 | 约 0.21(4090 bf16) | 自定义协议,需联系官方 | 有声书、播客、情绪配音 |
| Kokoro | StyleTTS 2 系 | 不支持克隆 | 可用(需 misaki[zh]) | CPU 实时可跑 | Apache-2.0 | 低成本生产部署、边缘设备 |
情感与韵律一档,IndexTTS 的 8 维情绪向量和 Fish Speech 的 1.5 万情绪标签是两个极端——前者精细可调,后者即插即用;CosyVoice 靠指令描述风格;GPT-SoVITS 偏「像」,情绪表达依赖参考音频本身。长文本稳定性上,自回归骨架的模型普遍需要切句或流式分段来避免跑飞,IndexTTS-2.5 的时长因子(0.5–2.0x)与 GPT-SoVITS 的 WebUI 切句管线都是针对这个问题的工程化答案。
上手最小示例:F5-TTS
在六个主力里,F5-TTS 装起来最简单,一条 pip 即可(以下命令以官方 README 为准;本文写作时已在 macOS、Python 3.13 环境实际执行 pip install f5-tts 装出 1.1.22 版并确认 CLI 参数可用,首次推理会自动从 Hugging Face 下载 v1 基模权重):
# 安装(建议独立虚拟环境)
pip install f5-tts
# 命令行合成:给参考音频与其文本,再给要合成的文本
f5-tts_infer-cli \
--model F5TTS_v1_Base \
--ref_audio "ref.wav" \
--ref_text "参考音频里说的那句话" \
--gen_text "要合成的目标文本。"
# 或者起一个本地 Gradio 网页操作台
f5-tts_infer-gradio --port 7860
--ref_text 留空时模型会自动跑 ASR 转写参考音频(多占一些显存/内存)。Apple Silicon 用户若嫌 PyTorch 轮子重,可以换社区维护的 f5-tts-mlx 路线。想零成本先听效果,官方 demo 页有在线样例。
伦理与合规:克隆能力越便宜,越要问「声音是谁的」
开源把克隆成本压到了几秒钟参考音频,也让「声音权益」从抽象概念变成了具体风险。三条线值得记住:
- 授权与人格权:中国《民法典》第 1023 条明确自然人声音参照肖像权保护;2024 年北京互联网法院审结的全国首例 AI 声音侵权案确认,具备可识别性的声音延展到 AI 化使用仍受保护,商业化使用需要专项明示授权——笼统的「录音授权」不等于「克隆授权」。给别人的声音做克隆之前,先拿到针对声音 AI 化的书面许可。
- 深度伪造与披露义务:欧盟 AI Act 第 50 条对合成内容设置了透明度义务(相关条款 2026 年 8 月起适用),美国田纳西州 ELVIS Act 等州法则把声音纳入公开权保护;国内司法解释与判例也在收紧对 AI 换声、换脸滥用的影响。
- 项目自身的护栏:许可证是第一道闸(Fish Speech、IndexTTS、XTTS-v2、ChatTTS 的权重全部非商用,F5-TTS 权重限非商用);ChatTTS 主动在训练中掺入高频噪声、压缩音质防克隆滥用;F5-TTS 对 CC-BY-NC 的说明、IndexTTS 的 DISCLAIMER 都属于同一路数。真正能商用落地的,目前主要是 Apache-2.0/MIT 系(CosyVoice、Kokoro、GPT-SoVITS 代码与自训权重)。
边界:开源与商业 API 还差多少
公开评测给出的图景是「接近但未追平」。有第三方评测统计称,到 2026 年年中开源与 ElevenLabs 的盲测 ELO 差距已缩小到约 81 分,个别开源模型在单项盲测里已能反复取胜(该数字出自单一第三方统计,仅供参考);而社区里也始终有「ElevenLabs v3 在情感表达和多语种一致性上仍无对手」的反方声音。从业界对比文章的共识看,差距不在「像不像」——零样本相似度开源已经够用——而在极端情感表现力、跨语种稳定性与开箱即用的工程可靠性上。考虑到本文所有项目的许可证差异,选型时建议同时把「法律成本」算进总账:一个 Apache-2.0 的 82M 小模型,在不少生产场景里比一个音质略好但不能商用的庞然大物更值钱。
参考资料
- F5-TTS GitHub 仓库(SWivid/F5-TTS)— https://github.com/SWivid/F5-TTS
- CosyVoice GitHub 仓库(FunAudioLLM/CosyVoice)— https://github.com/FunAudioLLM/CosyVoice
- GPT-SoVITS GitHub 仓库(RVC-Boss/GPT-SoVITS)— https://github.com/RVC-Boss/GPT-SoVITS
- Fish Speech GitHub 仓库(fishaudio/fish-speech)— https://github.com/fishaudio/fish-speech
- IndexTTS GitHub 仓库(index-tts/index-tts)— https://github.com/index-tts/index-tts
- Kokoro GitHub 仓库(hexgrad/kokoro)— https://github.com/hexgrad/kokoro
- Best Open-Source Text to Speech in 2026: 8 Free Models(TextToLab)— https://texttolab.com/blog/open-source-text-to-speech
- 清华大学程啸:利用 AI 克隆声音须严守法律边界 — https://www.tsinghua.edu.cn/info/1662/125077.htm
读者留言
COMMENTS 暂无还没有留言,来说第一句?