数据集

15 个数据集
已选筛选: PT 模型 清除所有筛选
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
GITATTRIBUTESJSONMDMODELMP3MVNPNGPTYAML Apache License 2.0 896 MiB 20 个文件 WeHub 同步于 2026-08-30 02:33:31 +00:00
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 3.8 MiB 8 个文件 WeHub 同步于 2026-08-29 21:03:42 +00:00
emotion2vec_plus_large 是一个通用语音情感识别基座模型,专注于从语音中识别出多种情感类别。它能够识别愤怒、厌恶、恐惧、开心、中性、其他、悲伤、惊讶和未知共9种情感状态,旨在通过大规模数据驱动的方式,提升跨语种和跨场景下的情感识别鲁棒性。该模型适用于需要从语音信号中提取情感信息的各类应用场景。
GITATTRIBUTESJSONMDPNGPTTXTWAVYAML Apache License 2.0 1.8 GiB 12 个文件 WeHub 同步于 2026-08-29 06:38:19 +00:00
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
GITATTRIBUTESGITIGNOREJSONMDMODELPTPYSAFETENSORSTXTYAML MIT License 40 GiB 64 个文件 WeHub 同步于 2026-08-28 10:58:25 +00:00
这是一个基于CT-Transformer架构的中文标点预测模型,适用于语音识别结果的后处理或纯文本输入的标点添加。它通过可控时延技术,在保持模型性能的同时有效降低了标点预测的延迟,能够在通用中文场景下输出具有可读性的文本。
GITATTRIBUTESJSONMDPNGPTTXTYAML Apache License 2.0 283 MiB 9 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。
GITATTRIBUTESJSONMDMVNPNGPTTXTWAVYAML Apache License 2.0 953 MiB 13 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 868 MiB 11 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
zai-org/GLM-TTS 已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
CKPTGITATTRIBUTESJSONMDMODELPTPYSAFETENSORSYAML MIT License 8.3 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZhejiangLab/Gengram 已完整同步
Gengram-10B 是一个为基因组基础模型设计的条件记忆模块,通过显式基序记忆检索增强基于 Transformer 的 DNA 序列建模。它采用哈希查找表存储和检索 k-mer(k=1-6),并引入 21 碱基对窗口机制以对齐 DNA 螺旋结构,在保持线性时间复杂度的同时提升计算效率。该模块兼容多种注意力机制(如 MHA、GQA、MLA),支持混合专家模型中的负载均衡,并具备生物可解释性:记忆嵌入呈现反向互补对称性,门控机制随功能区域变化,从浅层到深层形成层次化表示。
DISTCPGITATTRIBUTESJSONMDMETADATAPTTXT Apache License 2.0 145 GiB 1033 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Skywork/Matrix-Game 已完整同步
Matrix-Game是一个大规模Minecraft数据集,包含细粒度的键盘和鼠标动作标注,专为训练交互式、物理基础的世界模型而设计。该数据集可配合17B参数的扩散模型,用于生成高质量、可控的游戏世界视频,并支持对场景演化进行精细控制。
GITATTRIBUTESJSONMDPNGPTSAFETENSORS MIT License 81 GiB 29 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ByteDance/Q-Insight 已完整同步
Q-Insight 是一个专注于图像质量理解的视觉语言模型,通过视觉强化学习进行训练。它基于 Qwen2.5-VL-7B-Instruct 进行微调,采用 Apache-2.0 开源协议。该模型主要面向图像质量评估(IQA)、视频质量评估(VQA)以及 AIGC 内容的理解任务。
BINGITATTRIBUTESJSONMDNPZPKLPTSAFETENSORSTXT Apache License 2.0 80 GiB 92 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
BINGITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSSVG MIT License 99 GiB 34 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Fun-CosyVoice 3.0 是一个基于大语言模型的先进文本转语音(TTS)系统,在内容一致性、说话人相似度和韵律自然度上均超越前代。它支持9种常见语言(中、英、日、韩、德、西、法、意、俄)以及18种以上中文方言/口音,同时具备跨语言零样本语音克隆能力。系统还提供发音修复、文本标准化、低延迟流式输出和指令控制(如语言、情感、语速、音量)等实用功能,适合生产环境使用。
GITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSTXTYAML Apache License 2.0 9.1 GiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORS Apache License 2.0 40 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORSTXT Apache License 2.0 8.0 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00