选哪个 FunASR 模型?Nano vs MLT-Nano vs SenseVoice vs Paraformer(2026 选型指南)
FunASR 提供三个主力模型族,Fun-ASR 另有独立的 MLT-Nano 多语 checkpoint。一句话选型:有 GPU、识别中英日及中文方言/口音就用旗舰 Fun-ASR-Nano;需要 31 语种用 Fun-ASR-MLT-Nano;只有 CPU 用 SenseVoice;CPU 且纯中文、要时间戳/热词用 Paraformer。
一张表选型
| 你的情况 | 选 | 为什么 |
|---|---|---|
| 有 GPU / 中英日及中文方言/口音 / 要最强效果 | ⭐ Fun-ASR-Nano | LLM-ASR 旗舰,上下文/难例最强,中文 CER 8.06% |
| 需要广泛多语种覆盖 | Fun-ASR-MLT-Nano | 独立 checkpoint,覆盖 31 种语言 |
| 只有 CPU / 边缘 / 要最快 | SenseVoice | 非自回归极快,CPU 也能实时,多语种+情感,CER 7.81% |
| CPU + 纯中文 + 要时间戳/热词 | Paraformer | 最轻量,字级时间戳,热词定制,CER 10.18% |
表中的中文 CER 数据比较 Nano、SenseVoice 和 Paraformer,三者都远好于 Whisper(~20%)。CER 上 SenseVoice 略低,但 Fun-ASR-Nano 是基于 LLM 的旗舰模型——在真实复杂音频、上下文和专名上更鲁棒。MLT-Nano 用于 31 语种覆盖,不要把它的语言范围写到 Nano 上。
Fun-ASR-Nano —— LLM-ASR 旗舰,默认首选(GPU)
SenseVoice 编码器 + Qwen3-0.6B 解码,支持中文、英文、日语,以及 7 种中文方言和 26 种地域口音;具备 LLM 的上下文理解,难例与长尾词表现最好。
pip install funasr from funasr import AutoModel model = AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512", disable_update=True, device="cuda") res = model.generate(input="audio.wav") print(res[0]["text"]) # 欢迎大家来体验达摩院推出的语音识别模型。
模型:Hugging Face · ModelScope。大规模/高并发可用 vLLM 加速(实测约 340× 实时)。详见 Fun-ASR-Nano 使用指南。
Fun-ASR-MLT-Nano —— 独立的 31 语种 checkpoint(GPU)
需要跨 31 种语言识别时选择 MLT-Nano。它与旗舰 Nano 是两个独立 checkpoint,模型 ID 和语言范围都不同。
模型:Hugging Face · ModelScope。
SenseVoice —— CPU/边缘首选
非自回归、轻量极快,CPU 也能实时,一遍出语种+情感+音频事件;q8 量化仅约 250MB。CPU 部署或要最低延迟时首选。
from funasr import AutoModel from funasr.utils.postprocess_utils import rich_transcription_postprocess model = AutoModel(model="iic/SenseVoiceSmall", disable_update=True) # CPU 默认 res = model.generate(input="audio.wav", language="auto", use_itn=True) print(rich_transcription_postprocess(res[0]["text"])) # 欢迎大家来体验达摩院推出的语音识别模型。
Paraformer —— CPU + 纯中文(时间戳/热词)
最轻量的中文识别,提供字级时间戳和热词定制,做字幕或要逐字对齐时用它。
from funasr import AutoModel model = AutoModel(model="paraformer-zh", vad_model="fsmn-vad", punc_model="ct-punc") res = model.generate(input="audio.wav", batch_size_s=300) print(res[0]["text"]) # 欢迎大家来体验达摩院推出的语音识别模型。 # res[0]["timestamp"] -> [[880, 1120], [1120, 1360], ...] 每个字的起止毫秒
快速决策
- 要覆盖 31 语种? → Fun-ASR-MLT-Nano。
- 有 GPU,主要识别中英日及中文方言/口音? → Fun-ASR-Nano(默认旗舰)。
- 只有 CPU? 纯中文且要时间戳/热词 → Paraformer;否则(含多语种/情感) → SenseVoice。
- 要粤语? SenseVoice 原生支持,见 粤语语音识别。
更多:中文语音识别实战 · FunASR vs Whisper benchmark · Fun-ASR-Nano 指南。
FunASR 全家桶开源(MIT)——Fun-ASR-Nano / MLT-Nano + SenseVoice + Paraformer + VAD/标点/说话人。觉得有用就点个 Star 👇
也欢迎 Star:FunASR · SenseVoice · FunClip
相关文章
- FunASR vs Whisper 实测对比
- SenseVoice 部署指南
- Fun-ASR-Nano 使用指南
- 说话人分离:谁在何时说话
- 情感与语种检测
- 实时流式语音识别
- 转写超长音频(1小时一次搞定)
- 命令行转写(文本/JSON/SRT)
- 自托管 OpenAI Whisper API 替代
- 自动生成字幕(SRT / VTT)
- Python 语音转文字教程
- FunASR 跑进 llama.cpp(whisper.cpp 替代)
- FunASR vs faster-whisper(中文/粤语)
- 轻量语音识别(CPU 250MB)
- 自托管替代 Deepgram/AssemblyAI
- 粤语语音识别(SenseVoice 原生粤语)
- 日语语音识别(SenseVoice 转写+标点+情感)
- Python 语音活动检测(VAD)
- 自托管替代 Google/AWS/Azure 云语音 API
- 中文语音识别(普通话)实战
- 标点恢复 Python 实战
- 语音识别带时间戳(字级)