数据集

2 个数据集
已选筛选: 语音识别 TXT 模型 清除所有筛选
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
GITATTRIBUTESGITIGNOREJSONMDMODELPTPYSAFETENSORSTXTYAML MIT License 40 GiB 64 个文件 WeHub 同步于 2026-08-28 10:58:25 +00:00
这是一个基于CT-Transformer架构的中文标点预测模型,适用于语音识别结果的后处理或纯文本输入的标点添加。它通过可控时延技术,在保持模型性能的同时有效降低了标点预测的延迟,能够在通用中文场景下输出具有可读性的文本。
GITATTRIBUTESJSONMDPNGPTTXTYAML Apache License 2.0 283 MiB 9 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00