数据集
2 个数据集
热门分类:
SenseVoice多语言语音理解模型Small
已完整同步
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。