FSMN语音端点检测-中文-通用-16k-onnx 已完整同步
FSMN-Monophone VAD 模型介绍
Highlights
模型为FSMN-Monophone VAD的onnx量化导出版本,可以直接用来做生产部署,一键部署教程(点击此处)
ModelScope-FunASR
FunASR提供可便捷本地或者云端服务器部署的离线文件转写服务,内核为FunASR已开源runtime-SDK。 集成了达摩院语音实验室在Modelscope社区开源的语音端点检测(VAD)、Paraformer-large语音识别(ASR)、标点恢复(PUNC) 等相关能力,拥有完整的语音识别链路,可以将几十个小时的音频或视频识别成带标点的文字,而且支持上百路请求同时进行转写。
最新动态 | 环境安装 | 介绍文档 | 服务部署 | 模型库 | 联系我们
快速上手
docker安装
如果您已安装docker,忽略本步骤!! 通过下述命令在服务器上安装docker:
curl -O https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/shell/install_docker.sh;
sudo bash install_docker.sh
docker安装失败请参考 Docker Installation
镜像启动
通过下述命令拉取并启动FunASR runtime的docker镜像(获取最新镜像版本):
sudo docker pull \
registry.cn-hangzhou.aliyuncs.com/funasr_repo/funasr:funasr-runtime-sdk-cpu-0.3.0
mkdir -p ./funasr-runtime-resources/models
sudo docker run -p 10095:10095 -it --privileged=true \
-v $PWD/funasr-runtime-resources/models:/workspace/models \
registry.cn-hangzhou.aliyuncs.com/funasr_repo/funasr:funasr-runtime-sdk-cpu-0.3.0
服务端启动
docker启动之后,启动 funasr-wss-server服务程序:
cd FunASR/runtime
nohup bash run_server.sh \
--download-model-dir /workspace/models \
--vad-dir damo/speech_fsmn_vad_zh-cn-16k-common-onnx \
--model-dir damo/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-onnx \
--punc-dir damo/punc_ct-transformer_cn-en-common-vocab471067-large-onnx \
--lm-dir damo/speech_ngram_lm_zh-cn-ai-wesp-fst \
--itn-dir thuduj12/fst_itn_zh \
--hotword /workspace/models/hotwords.txt > log.out 2>&1 &
客户端测试与使用
运行上面安装指令后,会在./funasr-runtime-resources(默认安装目录)中下载客户端测试工具目录samples(下载点击此处), 我们以Python语言客户端为例,进行说明,支持多种音频格式输入(.wav, .pcm, .mp3等),也支持视频输入(.mp4等),以及多文件列表wav.scp输入,其他版本客户端请参考文档(点击此处)
python3 wss_client_asr.py --host "127.0.0.1" --port 10095 --mode offline --audio_in "../audio/asr_example.wav"
更详细用法介绍(点击此处)
相关论文以及引用信息
@inproceedings{zhang2018deep,
title={Deep-FSMN for large vocabulary continuous speech recognition},
author={Zhang, Shiliang and Lei, Ming and Yan, Zhijie and Dai, Lirong},
booktitle={2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)},
pages={5869--5873},
year={2018},
organization={IEEE}
}
7 个文件
浏览文件数据集版权信息
本数据集的许可证为 Apache License 2.0。如有违反相关条款,请联系 WEHUB,我们将及时处理。 查看许可证
通过 WeHub CLI 下载当前数据集快照。下列命令会固定为当前页面展示的数据版本(如果页面提供版本)。文件字节由本机直连存储下载,浏览器不会签发或保存下载链接。
前置要求
需要 Node.js 18 及以上,以及 npm(或 npx)。
1. 安装 CLI
npm install -g wehub-cli@latest
2. 下载此数据集
wehub datasets download ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --revision a158155ef9e81f405c052f40b6d1ad43b87e6215 --output ./ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1
若中断或部分失败,在同一目录重新执行同一命令即可续传。默认会校验 SHA-256。
免全局安装
npx --yes wehub-cli@latest datasets download ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --revision a158155ef9e81f405c052f40b6d1ad43b87e6215 --output ./ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1
高级选项
以下为 wehub datasets download 已支持的参数示例:
强制重新下载,不复用已校验的本地文件
wehub datasets download ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --revision a158155ef9e81f405c052f40b6d1ad43b87e6215 --output ./ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --overwrite
仅包含匹配路径
wehub datasets download ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --revision a158155ef9e81f405c052f40b6d1ad43b87e6215 --output ./ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --include "*.jsonl"
排除匹配路径
wehub datasets download ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --revision a158155ef9e81f405c052f40b6d1ad43b87e6215 --output ./ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --exclude "*.md"
提高并发下载数
wehub datasets download ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --revision a158155ef9e81f405c052f40b6d1ad43b87e6215 --output ./ds_iic_speech_fsmn_vad_zh_cn_16k_common_onnx_d102621eb1 --jobs 8
完整帮助:wehub datasets download --help