技术知识库 · 工具评测 · · 国科智飞 Gavin
2026 开源 TTS / STT 模型版图:从通用转写到语音 Agent 底座
闭源三家继续收敛,开源侧则分成了通用转写、中文工程化、多模态底座三条路线。按场景选,比按榜单选更可靠。
做语音功能的团队,2026 年要先面对一个分叉:直接调用闭源 API,还是走开源、可本地部署的路线。前者省事,能力上限也高;后者数据可控、可定制,长期成本更清晰。本文把我们 2026 年 4 月的语音模型观察整理成一张版图:先看主线趋势,再看开放权重里的代表选手,最后给出按场景的选型建议。文中信息来自公开模型资料与官方仓库,不含独立复测数据,版本迭代快,落地前请以官方仓库为准。
两条主线:STT 拼鲁棒,TTS 拼表达
STT 的近期主线是更高的准确率、更多语言、实时低延迟,以及噪声与口音下的鲁棒性——关键词是从"能转写"走向"生产环境可用"。
TTS 的主线则是更强表达力、更细的语气控制、多说话人能力,以及更自然的实时音频输出。简单说,STT 在解决"听得准",TTS 在解决"说得像人"。
闭源三家的路线也值得放在版图里对照:
- OpenAI 的音频能力继续围绕 GPT-4o 家族收敛,代表型号是 GPT-4o Transcribe、GPT-4o-mini-Transcribe 与 GPT-4o-mini-TTS,偏向 API 化与可控性;
- ElevenLabs 的 TTS 一直很强,同时把 STT 做成了生产级的实时 + 批量双路线,代表是 Scribe v2、Scribe v2 Realtime 与 Eleven v3;
- Google 更偏原生多模态音频,Gemini 2.5 TTS、Gemini 2.5 native audio、Gemini 3.1 Flash Live 面向实时交互与多说话人场景。
开源方案的能力天花板通常略低于这三家,但在私有化、成本和数据边界上有不可替代的价值。对多数团队来说,真正的选择不是"开源还是闭源",而是"哪一段链路必须自控":如果音频涉及客户资料、通话录音或医疗教育数据,STT 和 TTS 的部署位置往往是合规问题,而不是技术偏好问题。
另一个趋势是模型形态在分化。一部分项目坚持做"单点能力"——只做转写,或者只做合成,把工程边界划清楚;另一部分项目往"底座"方向走,把语音、视觉、实时交互揉进一个模型。选哪边,取决于你要的是可替换的零件,还是一体化的交互体验。
开源 STT:四条路线
Whisper / large-v3(openai/whisper)是通用性最成熟的基线:多语言支持扎实,适合通用转写、离线批处理,以及任何不想在选型上冒险的项目。它不是最新锐的模型,但非常像"老而稳的板砖"。
FunASR / Paraformer(modelscope/FunASR)走中文工程化路线:高精度、低延迟,可做 VAD、标点、热词和说话人相关能力,适合中文语音识别、企业级转写和实时字幕。它的强项不在论文指标,而在把中文场景的工程问题都替你想好了。
SenseVoice(FunAudioLLM/SenseVoice)更像一个语音理解模型:一条模型同时输出 ASR、语种识别(LID)、情绪识别(SER)和音频事件检测(AED)。适合中文/多语种识别、情绪分析和事件检测,而不只是纯转写。
SeamlessM4T / SeamlessStreaming(facebookresearch/seamless_communication)覆盖 ASR、翻译和流式场景,偏跨语言语音处理。如果你只要纯 STT,它的技能树显得太大;但如果要做语音翻译或跨语种助手,这条线很完整。
Distil-Whisper(huggingface/distil-whisper)更小更快,适合英文为主、资源受限的部署,不是中文主力。
这五条路线并不互斥。工程上常见的组合是:用 FunASR 做 VAD 和标点,用 SenseVoice 或 Paraformer 出转写,再用热词表修业务术语;Whisper 则留作离线复盘的兜底。把每段工序拆开选工具,比赌一个"全能模型"更稳。
开源 TTS:三个梯队
高质量通用这一档有三个常被点名的项目。CosyVoice 2 / 3(FunAudioLLM/CosyVoice)多语言、零样本克隆、实时性强,CosyVoice 3 比 2 更强,适合语音 Agent、中文 TTS 和实时播报,属于第一梯队。Fish Speech / Fish Audio S2(fishaudio/fish-speech)在开源里质量和可控性突出,支持多说话人、长文本和流式,适合高质量播报与情绪风格控制,但许可与商用边界要仔细看。F5-TTS(SWivid/F5-TTS)非自回归、zero-shot 表现好、自然度高,适合高质量合成与克隆实验,工程化成熟度则要看具体版本。
本地轻量档:Piper(rhasspy/piper)轻量、本地、低延迟,适合端侧和资源受限设备,质量不一定最顶,但部署很省心;XTTS v2(coqui-ai/TTS)是跨语言 voice cloning 的经典方案,3~6 秒参考音频即可,适合多语言克隆和快速原型。
端到端底座是另一类物种:MiniCPM-o 2.6 / 4.5、Qwen2.5-Omni、VibeVoice 这类模型更像"语音 + 视觉 + 实时双工"的 Agent 底座,而不是单点的 TTS / STT API。以 MiniCPM-o 为例,2.6 支持中英双语实时语音对话和 zero-shot TTS / voice cloning;4.5 在此之上支持可配置声音,以及连续视频 + 音频流的端到端处理,强调更自然、更稳定。需要注意:它不像 OpenAI / ElevenLabs 那样是标准化单点 API,更偏模型库与方案栈。
能力对比
| 方向 | 代表项目 | 适合谁 | 主要取舍 |
|---|---|---|---|
| 通用 STT | Whisper large-v3 | 离线批处理、多语种基线 | 不是最新锐 |
| 中文 STT | FunASR / Paraformer | 企业转写、实时字幕 | 生态偏中文 |
| 语音理解 | SenseVoice | 情绪、事件、多语种 | 输出多、链路要设计 |
| 跨语种 | SeamlessM4T / SeamlessStreaming | 语音翻译、跨语种助手 | 对纯 STT 偏重 |
| 通用 TTS | CosyVoice 3、Fish Speech、F5-TTS | 语音 Agent、高质量播报 | 许可与版本差异 |
| 轻量 TTS | Piper、XTTS v2 | 端侧、离线、快速原型 | 质量上限一般 |
| 端到端底座 | MiniCPM-o、Qwen2.5-Omni、VibeVoice | 全双工、多模态交互 | 不是标准 API |
选型建议
做中文语音 Agent:STT 优先 FunASR / SenseVoice,TTS 选 CosyVoice 3 / Fish Speech,端到端底座考虑 MiniCPM-o / Qwen2.5-Omni。
做本地离线:STT 用 Whisper large-v3,英文场景可换 Distil-Whisper;TTS 用 Piper,克隆需求加 XTTS v2。
追求开源体验上限:STT 用 SenseVoice + FunASR 的组合思路,TTS 看 CosyVoice 3 / Fish Speech / F5-TTS,Agent 底座看 MiniCPM-o 4.5 / Qwen2.5-Omni / VibeVoice。
选型之前先问四个问题
第一,实时还是批量? 实时链路看首字延迟和流式稳定性,批量链路看准确率和吞吐,两者的候选池几乎不重叠。很多项目失败,是因为拿离线模型硬做实时。
第二,中文还是多语种? 中文场景优先 FunASR / SenseVoice 这一系,多语种再考虑 Whisper 和 Seamless。通用榜单的第一名未必适合你的语种和口音分布。
第三,能不能接受数据出内网? 这决定了开源方案是"可选项"还是"必选项"。对金融、医疗、政务场景,私有化部署往往是硬门槛而不是加分项。
第四,团队有没有工程化能力? 开源不等于免费,模型部署、并发、监控、版本升级都要人维护。评估成本时要把这部分算进去,而不是只算 GPU 账单。
最后三个提醒。第一,音色克隆涉及授权与合规,开源许可也要提前看商用边界,不要等到产品化那天。第二,本文信息来自公开资料与官方仓库,不含独立复测数据,上线前务必用真实业务音频验证。第三,语音模型的版本迭代很快,今天的第一梯队几个月后可能就会换位,选型时优先保证架构可替换。
参考来源
- Whisper:https://github.com/openai/whisper
- FunASR:https://github.com/modelscope/FunASR
- SenseVoice:https://github.com/FunAudioLLM/SenseVoice
- Seamless:https://github.com/facebookresearch/seamless_communication
- Distil-Whisper:https://github.com/huggingface/distil-whisper
- CosyVoice:https://github.com/FunAudioLLM/CosyVoice
- Fish Speech:https://github.com/fishaudio/fish-speech
- F5-TTS:https://github.com/SWivid/F5-TTS
- XTTS v2:https://huggingface.co/coqui/XTTS-v2
- Piper:https://github.com/rhasspy/piper