部署合同

vLLM 原生 FunASR 服务

通过 vLLM 内置的 FunASR 架构,在 NVIDIA GPU 上提供兼容 OpenAI 的多语言转写与热词接口。

成熟度
社区验证
FunASR
Fun-ASR-Nano-2512 conversion@e718b36e
运行时
vLLM 0.27.1+cu129 / Torch 2.13.0+cu129
验证日期
2026-08-13

适用边界

先判断它是否适合你的生产约束

适合

  • 需要标准 /v1/audio/transcriptions 接口
  • Fun-ASR-Nano 批量或并发转写
  • 已有 NVIDIA GPU 和 Linux 服务环境

不适合

  • 只接受官方发布权重、不能使用社区转换 checkpoint
  • 纯 CPU 或边缘设备
  • 尚未完成显存、并发与业务音频压测的公网服务
模型Fun-ASR-Nano-2512 (community vLLM conversion)
硬件nvidia-gpu / kubernetes
操作系统Linux
接口OpenAI-compatible HTTP

运行路径

从安装到已知音频验证

以下命令来自当前验证清单;上线前固定依赖、模型和硬件。

安装

curl -fL https://github.com/vllm-project/vllm/releases/download/v0.27.1/vllm-0.27.1%2Bcu129-cp38-abi3-manylinux_2_28_x86_64.whl -o vllm-0.27.1+cu129-cp38-abi3-manylinux_2_28_x86_64.whl
echo "bf0d52faa2a51e7a01c6856a7a8a2d1307fd0ff711415d34168a67ffac0fa47b  vllm-0.27.1+cu129-cp38-abi3-manylinux_2_28_x86_64.whl" | sha256sum -c -
uv venv --python 3.12 .venv && uv pip install --python .venv/bin/python --torch-backend=auto "vllm[audio] @ file://$PWD/vllm-0.27.1+cu129-cp38-abi3-manylinux_2_28_x86_64.whl"

启动

CUDA_VISIBLE_DEVICES=0 .venv/bin/vllm serve allendou/Fun-ASR-Nano-2512-vllm --revision e718b36e2578203ec893e9b488239225f8d668e2 --served-model-name fun-asr-nano --host 127.0.0.1 --port 8899 --dtype float32 --gpu-memory-utilization 0.40 --enforce-eager

健康检查

curl -fsS http://127.0.0.1:8899/health
curl -fsS http://127.0.0.1:8899/v1/models

Smoke test

发布前必须通过的最小验证

curl -fL https://huggingface.co/allendou/Fun-ASR-Nano-2512-vllm/resolve/e718b36e2578203ec893e9b488239225f8d668e2/example/zh.mp3 -o zh.mp3 && echo "0e64de19e4ff9a02e682955c9112f32d2317cfdbb5bc2f3504664044c993f195  zh.mp3" | sha256sum -c -
curl -fsS http://127.0.0.1:8899/v1/audio/transcriptions -F file=@zh.mp3 -F model=fun-asr-nano -F language=zh -F response_format=json
curl -fsS http://127.0.0.1:8899/v1/audio/transcriptions -F file=@zh.mp3 -F model=fun-asr-nano -F language=zh -F 'hotwords=开放时间,开放时间,开放时间' -F response_format=json

运行与容量

把可运行推进到可运营

运行检查

  • 固定 vLLM wheel、Torch、CUDA、模型 revision 与音频依赖
  • 等待 /health 就绪并完成预热后再采集容量数据
  • 记录队列等待、最终结果延迟、显存和热词命中率

容量变量

  • 音频时长、语言、声道和 VAD 分段分布
  • 并发、队列等待、预热与模型缓存状态
  • 精确硬件、驱动、运行时和线程配置

故障排查

  • 音频返回 400 时确认安装了 vllm[audio]
  • 启动时 KV cache 不足则提高显存利用率或在业务允许时降低 max-model-len
  • 非英文请求必须显式传 language;热词用逗号分隔并以真实业务样本验证偏置强度

安全边界

生产入口默认不信任

已知限制

当前原生 vLLM 路径依赖社区转换 checkpoint;要求官方权重链路时使用官方 FunASR split-engine。实测仅覆盖单张 H100,必须按目标 GPU、音频、语言、热词与流量复测。

公开基准仅用于复现起点,不替代目标业务负载测试。

证据与反馈

从原始资料核对部署合同