数据集

5 个数据集
已选筛选: MVN 清除所有筛选
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
GITATTRIBUTESJSONMDMODELMP3MVNPNGPTYAML Apache License 2.0 896 MiB 20 个文件 WeHub 同步于 2026-08-30 02:33:31 +00:00
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 3.8 MiB 8 个文件 WeHub 同步于 2026-08-29 21:03:42 +00:00
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。
GITATTRIBUTESJSONMDMVNPNGPTTXTWAVYAML Apache License 2.0 953 MiB 13 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 868 MiB 11 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
FSMN语音端点检测(VAD)模型专为中文通用场景设计,支持16kHz采样率的音频输入。该模型基于FSMN架构,已导出为ONNX量化格式,便于在生产环境中直接部署,实现高效的语音活性检测。它能够准确判断音频中语音段的起止位置,适用于实时或离线语音识别等任务。
GITATTRIBUTESJSONMDMVNONNXYAML Apache License 2.0 511 KiB 7 个文件 WeHub 同步于 2026-08-20 02:05:54 +00:00