适用边界
先判断它是否适合你的生产约束
适合
- 需要标准 /v1/audio/transcriptions 接口
- Fun-ASR-Nano 批量或并发转写
- 已有 NVIDIA GPU 和 Linux 服务环境
不适合
- 只接受官方发布权重、不能使用社区转换 checkpoint
- 纯 CPU 或边缘设备
- 尚未完成显存、并发与业务音频压测的公网服务
| 模型 | Fun-ASR-Nano-2512 (community vLLM conversion) |
|---|---|
| 硬件 | nvidia-gpu / kubernetes |
| 操作系统 | Linux |
| 接口 | OpenAI-compatible HTTP |
运行路径
从安装到已知音频验证
以下命令来自当前验证清单;上线前固定依赖、模型和硬件。
安装
curl -fL https://github.com/vllm-project/vllm/releases/download/v0.27.1/vllm-0.27.1%2Bcu129-cp38-abi3-manylinux_2_28_x86_64.whl -o vllm-0.27.1+cu129-cp38-abi3-manylinux_2_28_x86_64.whl
echo "bf0d52faa2a51e7a01c6856a7a8a2d1307fd0ff711415d34168a67ffac0fa47b vllm-0.27.1+cu129-cp38-abi3-manylinux_2_28_x86_64.whl" | sha256sum -c -
uv venv --python 3.12 .venv && uv pip install --python .venv/bin/python --torch-backend=auto "vllm[audio] @ file://$PWD/vllm-0.27.1+cu129-cp38-abi3-manylinux_2_28_x86_64.whl"
启动
CUDA_VISIBLE_DEVICES=0 .venv/bin/vllm serve allendou/Fun-ASR-Nano-2512-vllm --revision e718b36e2578203ec893e9b488239225f8d668e2 --served-model-name fun-asr-nano --host 127.0.0.1 --port 8899 --dtype float32 --gpu-memory-utilization 0.40 --enforce-eager
健康检查
curl -fsS http://127.0.0.1:8899/health
curl -fsS http://127.0.0.1:8899/v1/models
Smoke test
发布前必须通过的最小验证
curl -fL https://huggingface.co/allendou/Fun-ASR-Nano-2512-vllm/resolve/e718b36e2578203ec893e9b488239225f8d668e2/example/zh.mp3 -o zh.mp3 && echo "0e64de19e4ff9a02e682955c9112f32d2317cfdbb5bc2f3504664044c993f195 zh.mp3" | sha256sum -c -
curl -fsS http://127.0.0.1:8899/v1/audio/transcriptions -F file=@zh.mp3 -F model=fun-asr-nano -F language=zh -F response_format=json
curl -fsS http://127.0.0.1:8899/v1/audio/transcriptions -F file=@zh.mp3 -F model=fun-asr-nano -F language=zh -F 'hotwords=开放时间,开放时间,开放时间' -F response_format=json
运行与容量
把可运行推进到可运营
运行检查
- 固定 vLLM wheel、Torch、CUDA、模型 revision 与音频依赖
- 等待 /health 就绪并完成预热后再采集容量数据
- 记录队列等待、最终结果延迟、显存和热词命中率
容量变量
- 音频时长、语言、声道和 VAD 分段分布
- 并发、队列等待、预热与模型缓存状态
- 精确硬件、驱动、运行时和线程配置
故障排查
- 音频返回 400 时确认安装了 vllm[audio]
- 启动时 KV cache 不足则提高显存利用率或在业务允许时降低 max-model-len
- 非英文请求必须显式传 language;热词用逗号分隔并以真实业务样本验证偏置强度
安全边界
生产入口默认不信任
- 在 API 网关实现认证、TLS、限流和音频大小/时长限制
- worker 仅绑定内网地址,不直接暴露公网
- 校验 wheel、模型 revision 和示例音频摘要,隔离模型缓存与上传临时目录
已知限制
当前原生 vLLM 路径依赖社区转换 checkpoint;要求官方权重链路时使用官方 FunASR split-engine。实测仅覆盖单张 H100,必须按目标 GPU、音频、语言、热词与流量复测。
公开基准仅用于复现起点,不替代目标业务负载测试。
证据与反馈