选哪个 FunASR 模型?Nano vs MLT-Nano vs SenseVoice vs Paraformer(2026 选型指南)

FunASR 提供三个主力模型族,Fun-ASR 另有独立的 MLT-Nano 多语 checkpoint。一句话选型:有 GPU、识别中英日及中文方言/口音就用旗舰 Fun-ASR-Nano;需要 31 语种用 Fun-ASR-MLT-Nano;只有 CPU 用 SenseVoice;CPU 且纯中文、要时间戳/热词用 Paraformer。

一张表选型

你的情况为什么
有 GPU / 中英日及中文方言/口音 / 要最强效果Fun-ASR-NanoLLM-ASR 旗舰,上下文/难例最强,中文 CER 8.06%
需要广泛多语种覆盖Fun-ASR-MLT-Nano独立 checkpoint,覆盖 31 种语言
只有 CPU / 边缘 / 要最快SenseVoice非自回归极快,CPU 也能实时,多语种+情感,CER 7.81%
CPU + 纯中文 + 要时间戳/热词Paraformer最轻量,字级时间戳,热词定制,CER 10.18%

表中的中文 CER 数据比较 Nano、SenseVoice 和 Paraformer,三者都远好于 Whisper(~20%)。CER 上 SenseVoice 略低,但 Fun-ASR-Nano 是基于 LLM 的旗舰模型——在真实复杂音频、上下文和专名上更鲁棒。MLT-Nano 用于 31 语种覆盖,不要把它的语言范围写到 Nano 上。

Fun-ASR-Nano —— LLM-ASR 旗舰,默认首选(GPU)

SenseVoice 编码器 + Qwen3-0.6B 解码,支持中文、英文、日语,以及 7 种中文方言和 26 种地域口音;具备 LLM 的上下文理解,难例与长尾词表现最好。

pip install funasr

from funasr import AutoModel

model = AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512", disable_update=True, device="cuda")
res = model.generate(input="audio.wav")

print(res[0]["text"])
# 欢迎大家来体验达摩院推出的语音识别模型。

模型:Hugging Face · ModelScope。大规模/高并发可用 vLLM 加速(实测约 340× 实时)。详见 Fun-ASR-Nano 使用指南

Fun-ASR-MLT-Nano —— 独立的 31 语种 checkpoint(GPU)

需要跨 31 种语言识别时选择 MLT-Nano。它与旗舰 Nano 是两个独立 checkpoint,模型 ID 和语言范围都不同。

模型:Hugging Face · ModelScope

SenseVoice —— CPU/边缘首选

非自回归、轻量极快,CPU 也能实时,一遍出语种+情感+音频事件;q8 量化仅约 250MB。CPU 部署或要最低延迟时首选。

from funasr import AutoModel
from funasr.utils.postprocess_utils import rich_transcription_postprocess

model = AutoModel(model="iic/SenseVoiceSmall", disable_update=True)  # CPU 默认
res = model.generate(input="audio.wav", language="auto", use_itn=True)

print(rich_transcription_postprocess(res[0]["text"]))
# 欢迎大家来体验达摩院推出的语音识别模型。

Paraformer —— CPU + 纯中文(时间戳/热词)

最轻量的中文识别,提供字级时间戳热词定制,做字幕或要逐字对齐时用它。

from funasr import AutoModel

model = AutoModel(model="paraformer-zh", vad_model="fsmn-vad", punc_model="ct-punc")
res = model.generate(input="audio.wav", batch_size_s=300)

print(res[0]["text"])
# 欢迎大家来体验达摩院推出的语音识别模型。
# res[0]["timestamp"] -> [[880, 1120], [1120, 1360], ...] 每个字的起止毫秒

快速决策

更多:中文语音识别实战 · FunASR vs Whisper benchmark · Fun-ASR-Nano 指南

FunASR 全家桶开源(MIT)——Fun-ASR-Nano / MLT-Nano + SenseVoice + Paraformer + VAD/标点/说话人。觉得有用就点个 Star 👇

⭐ Star Fun-ASR

也欢迎 Star:FunASR · SenseVoice · FunClip

相关文章