部署合同

llama.cpp / GGUF 独立运行

使用 v0.2.0 的九个预编译包或源码构建,在 CPU、Vulkan、CUDA 和边缘设备上运行 FunASR GGUF 模型。

成熟度
生产验证
FunASR
runtime-llamacpp-v0.2.0
运行时
llama.cpp@803b7fca
验证日期
2026-08-11

适用边界

先判断它是否适合你的生产约束

适合

  • 不依赖 Python ML 环境
  • 桌面应用和离线边缘部署
  • 需要 Linux、macOS、Windows 的 CPU、Vulkan 或 CUDA 发布包

不适合

  • 需要 vLLM 式大批量 GPU 调度
  • 未验证目标 GPU 架构的通用预编译 CUDA 包
  • 必须使用完整 Python 模型生态的流程
模型SenseVoiceSmall-GGUF / Paraformer-GGUF / Fun-ASR-Nano-GGUF / FSMN-VAD-GGUF
硬件cpu / desktop-edge-gpu
操作系统Linux / macOS / Windows
接口CLI / local HTTP server

发布资产

按操作系统和后端下载已校验的预编译包

SHA-256 来自公开 GitHub Release;下载后先核对摘要,再在目标硬件完成 smoke test。

系统 架构 后端 下载 SHA-256
Linux arm64 CPU funasr-llamacpp-linux-arm64.tar.gz c78987b2384c6aef339aea1bcd0e130070455d6394fa7ab7ca26840ead10d5da
Linux x64 CPU funasr-llamacpp-linux-x64.tar.gz 15e6407143b4fb91d90bb37f2a41c64c4d48ea0fbe6404b88a9b70269c84f240
Linux x64 AVX2 CPU funasr-llamacpp-linux-x64-avx2.tar.gz 02e10e9a46ea76a040c45d431efe51a3324e64f08c24d38e18c8a4d2781490cd
Linux x64 Vulkan funasr-llamacpp-linux-x64-vulkan.tar.gz caf71b8c0b4c3249cebc4175e5406d3c588eb9e8966a00d571d4cc5070405385
macOS arm64 CPU funasr-llamacpp-macos-arm64.tar.gz 416cbb289e31cb7575365d382155074e922fd061807a37b9ca0247dabd9bc6f9
Windows x64 CPU funasr-llamacpp-windows-x64.zip 297c962346d7e30d7a7c2c860dfaab3ff07d01fddf15e6fc5212ca9545441a51
Windows x64 AVX2 CPU funasr-llamacpp-windows-x64-avx2.zip 4db0f11f603c324a63545cd7009cdd45bb45576efe282cec22796b5fd42d8ea1
Windows x64 Vulkan funasr-llamacpp-windows-x64-vulkan.zip 90b45240c6ccc9177c25490a11848de60a406e129391c8736b14521c0c28cdcb
Windows x64 CUDA funasr-llamacpp-windows-x64-cuda.zip 7f2f9ef4d7e0291b284a295ec74bbeca9ea635a7f5f42d0ad06eb780c0d6efc1

运行路径

从安装到已知音频验证

以下命令来自当前验证清单;上线前固定依赖、模型和硬件。

安装

curl -fLO https://github.com/modelscope/FunASR/releases/download/runtime-llamacpp-v0.2.0/funasr-llamacpp-linux-x64.tar.gz
echo "15e6407143b4fb91d90bb37f2a41c64c4d48ea0fbe6404b88a9b70269c84f240  funasr-llamacpp-linux-x64.tar.gz" | sha256sum -c -
mkdir funasr-llamacpp && tar -xzf funasr-llamacpp-linux-x64.tar.gz -C funasr-llamacpp && cd funasr-llamacpp && bash download-funasr-model.sh sensevoice ./funasr-gguf f16

启动

cd funasr-llamacpp && ./llama-funasr-sensevoice -m funasr-gguf/sensevoice-small-f16.gguf --vad funasr-gguf/fsmn-vad.gguf -a sample.wav

健康检查

cd funasr-llamacpp && ./llama-funasr-sensevoice --help

Smoke test

发布前必须通过的最小验证

cd funasr-llamacpp && ./llama-funasr-sensevoice -m funasr-gguf/sensevoice-small-f16.gguf --vad funasr-gguf/fsmn-vad.gguf -a sample.wav | tee transcript.txt && test -s transcript.txt

运行与容量

把可运行推进到可运营

运行检查

  • 按页面列出的 SHA-256 校验九个发布资产
  • 模型和二进制使用同一发布清单
  • 保留旧二进制和模型目录用于回滚

容量变量

  • 音频时长、语言、声道和 VAD 分段分布
  • 并发、队列等待、预热与模型缓存状态
  • 精确硬件、驱动、运行时和线程配置

故障排查

  • CPU 路径先用 q8 模型验证
  • CUDA 和 Vulkan 必须匹配本机驱动
  • Windows AMD Vulkan 异常时记录 GPU、驱动、GGML_VK_MAX_NODES_PER_SUBMIT 和 GGML_VK_SERIALIZE_SUBMISSIONS 后回报

安全边界

生产入口默认不信任

已知限制

预编译 GPU 包只覆盖标注的后端和架构;Windows AMD Vulkan 的崩溃修复仍需问题报告者实机复测,其他设备也必须在目标硬件验证。

公开基准仅用于复现起点,不替代目标业务负载测试。

证据与反馈

从原始资料核对部署合同