全部文章
保留全部历史文章。旧文中的版本与测量对应当时环境,当前配置请以维护中的文档为准。
v1.4.16:混合设备子模型修复
保持 VAD、标点和说话人子模型的显式设备配置,并补齐原生 Transformers 指南。
微调后,怎样确认模型真的更好?
从一次持续学习反馈出发,先验证评测尺子,再选择 checkpoint,最后检查真实服务。
会议转写,怎样才算做好了?
有文字还不够:检查关键内容、说话人轮次和时间覆盖。
接入 Transformers,先选对权重
同名模型的权重格式不能混用。先理清格式,再跑通原生接入。
v1.4.14:源码包与 MOSS 入口
把多人录音变成可剪辑的字幕
从一段对话出发,生成带匿名说话人标签的字幕,再按人选段。
v1.4.5:Python 依赖与运行时
v1.4.3:VAD 与说话人聚类
在 Subtitle Edit 中生成本地字幕
v1.4.0:安装包与参数校验
FunClip v2.1.0:首个版本化发布
v1.3.28:实时识别与字幕修复
v1.3.27:语种信息与回退处理
v1.3.26:API 与运行时入口
FunASR 模型选型笔记
用时间戳定位原始录音
迁移语音 API 前,先核对什么
文字都在,标点为什么还是断错?
保留原始转写,生成标点候选,再检查归句和专名,不把句号当作语义修复。
VAD 如何找到语音区间
自托管语音服务的迁移笔记
CPU 语音识别的部署取舍
日语录音转写实践
中文录音转写入门
中文与粤语:历史对比实验
粤语录音转写实践
用 llama.cpp 部署中文语音识别
SenseVoice 的情绪标签,该怎么用?
保留原始预测,区分显示文本与评测标签,不把分类结果当作人的真实情绪。
用 Python 转写一份录音
把语音转写接进自己的 API
先跑通本地请求,再明确鉴权、返回格式和服务责任。
字幕文件生成了,然后呢?
从一段普通话录音得到 SRT,转换为 VTT,再回听检查时间与文字。
从命令行转写音频
长录音为什么会漏掉结尾?
从切分边界、生成上限和结果覆盖出发,检查长录音的遗漏。