连接 GPU、CPU、边缘设备和 API 客户端的私有部署拓扑

开源语音基础设施

FunASR

可私有化部署的语音智能基础设施。覆盖 GPU 高吞吐、实时流式服务、OpenAI 兼容 API,以及 CPU 与边缘独立运行。

许可
Apache-2.0
接口
OpenAI compatible
验证日期
2026-08-13

部署选择器

从工作负载开始,不从框架名开始

选择业务形态、硬件和首要目标,得到一条有明确限制的推荐路径。

工作负载
硬件
优先目标

完整矩阵

无 JavaScript 也能完成选择

方案 工作负载 硬件 接口 状态
vLLM 原生 FunASR 服务 batch / private-api nvidia-gpu / kubernetes OpenAI-compatible HTTP 社区验证
SenseVoice TensorRT / Triton batch / private-api nvidia-gpu / kubernetes Triton gRPC/HTTP / TensorRT plan 生产验证
llama.cpp / GGUF 独立运行 edge / batch cpu / desktop-edge-gpu CLI / local HTTP server 生产验证
SenseVoice 原生 OpenAI 实时服务 private-api / realtime / edge cpu / nvidia-gpu OpenAI-compatible HTTP / OpenAI realtime WebSocket 生产验证
audio.cpp 原生 Fun-ASR-Nano 与 SenseVoice edge / batch / private-api cpu / nvidia-gpu / desktop-edge-gpu CLI / OpenAI-compatible HTTP 社区验证
OpenAI 兼容私有 API private-api / batch cpu / nvidia-gpu / kubernetes OpenAI-compatible HTTP / OpenAPI 生产验证
实时流式与字幕 realtime cpu / nvidia-gpu / kubernetes WebSocket / Python client 社区验证
容器与 Kubernetes private-api / batch / realtime kubernetes / cpu / nvidia-gpu Docker Compose / Kubernetes ClusterIP 社区验证
ONNX / C++ CPU 运行时 batch / realtime / edge cpu C++ / ONNX Runtime 社区验证
生产上线检查 private-api / batch / realtime / edge cpu / nvidia-gpu / desktop-edge-gpu / kubernetes HTTP / WebSocket 生产验证

可验证接口

先验证服务,再接入客户端

健康、模型身份和真实转写是三个独立检查。

localhost:8000
$ curl -fsS http://localhost:8000/health
{"status":"ok"}

$ curl -fsS http://localhost:8000/v1/models
{"data":[{"id":"sensevoice"}]}

$ curl http://localhost:8000/v1/audio/transcriptions \
  -F file=@meeting.wav -F model=sensevoice

生产边界

运行时负责推理,平台负责暴露方式

FunASR 原生

模型加载、转写接口、时间戳、VAD、流式协议和运行时日志。

网关与平台

TLS、认证、租户配额、限流、审计、上传策略、监控和滚动发布。

上线证据

目标硬件的容量测试、已知音频 smoke test、版本清单和可执行回滚。

生态仓库

从模型到视频工作流

按目标进入专用仓库,核对模型、部署边界与可复现示例。

端到端语音识别

Fun-ASR

端到端语音识别模型家族,覆盖旗舰与 31 语言 MLT 检查点。

查看 Fun-ASR

多语言语音理解

SenseVoice

覆盖语音识别、语言、情感与音频事件的多语言理解模型。

查看 SenseVoice

视频理解与剪辑

FunClip

以语音与文本定位为核心的视频理解与智能剪辑工作流。

查看 FunClip

下一步

选择一条路径,完成第一次可复现验证