数据集
72 个数据集
热门分类:
SenseVoice多语言语音理解模型Small
已完整同步
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
FSMN语音端点检测-中文-通用-16k
已完整同步
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
emotion2vec_plus_large 是一个通用语音情感识别基座模型,专注于从语音中识别出多种情感类别。它能够识别愤怒、厌恶、恐惧、开心、中性、其他、悲伤、惊讶和未知共9种情感状态,旨在通过大规模数据驱动的方式,提升跨语种和跨场景下的情感识别鲁棒性。该模型适用于需要从语音信号中提取情感信息的各类应用场景。
Bill13579/beltout
已完整同步
BeltOut 是一个基于 ChatterboxVC 的零样本语音到语音音色迁移模型,能够在不改变原始表演细节(如语调、情感)的前提下,仅替换音色(timbre)。它通过 192 维的 x-vector 表示任意音色,可应用于任意输入语音,实现精准的音色转换。该模型旨在学习音色对表演传递的通用影响,从而生成与目标音色一致的完整语音输出。
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
microsoft/VibeVoice-1.5B
已完整同步
VibeVoice是一款面向多说话人、长篇幅对话音频生成的开源文本转语音模型,支持英文和中文。它采用创新的连续语音分词器(声学和语义),以超低帧率(7.5Hz)高效保留音频质量,并结合大语言模型与扩散解码器,能够从文本直接合成最长90分钟、包含最多4个不同说话人的自然对话音频(如播客)。该模型基于Qwen2.5-1.5B架构,通过课程学习策略逐步扩展上下文长度至65,536个token,在保持说话人一致性和流畅对话轮换方面表现出色。
这是一个基于CT-Transformer架构的中文标点预测模型,适用于语音识别结果的后处理或纯文本输入的标点添加。它通过可控时延技术,在保持模型性能的同时有效降低了标点预测的延迟,能够在通用中文场景下输出具有可读性的文本。
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
FSMN语音端点检测(VAD)模型专为中文通用场景设计,支持16kHz采样率的音频输入。该模型基于FSMN架构,已导出为ONNX量化格式,便于在生产环境中直接部署,实现高效的语音活性检测。它能够准确判断音频中语音段的起止位置,适用于实时或离线语音识别等任务。
Qwen3-30B-A3B-Thinking-2507 是一个基于 Transformer 的因果语言模型,采用混合专家(MoE)架构,总参数量为 30.5B,每次推理仅激活 3.3B 参数。它原生支持高达 262K 的上下文长度,在逻辑推理、数学、科学、编程等复杂推理任务上表现显著提升,同时指令遵循、工具使用、文本生成等通用能力也有明显增强。该模型默认开启深度思考模式,特别适合处理高复杂度的推理场景。
BAAI/bge-small-en-v1.5
已完整同步
这是一个轻量级的英文句子嵌入模型,属于bge系列,能够将文本转换为向量表示,适用于特征提取、句子相似度计算和语义搜索等任务。它在多个自然语言处理基准测试中表现出色,涵盖分类、检索、聚类、重排序和语义文本相似度等场景,兼顾了效率与性能。
BERT base uncased是一个基于Transformer架构的预训练语言模型,通过掩码语言建模和下一句预测两个自监督任务,在大规模英文语料上学习到了丰富的语言表示。该模型不区分大小写,拥有约1.1亿参数,适用于多种自然语言处理下游任务的微调,如文本分类、问答和命名实体识别等。
zai-org/GLM-4.7
已完整同步
GLM-4.7是一个专注于编码和复杂推理的语言模型,支持英文和中文。相比前代,它在多语言代理编码、终端任务、工具使用和复杂推理方面均有显著提升,同时优化了UI生成质量,能够生成更精美、布局更准确的网页和幻灯片。
这是一个中文句子嵌入模型,基于CoSENT方法训练,能够将句子映射为768维的稠密向量,适用于语义相似度计算、文本匹配和语义搜索等任务。模型在多个中文语义评测数据集上取得了较好的表现。
Qwen/Qwen3.5-4B
已完整同步
Qwen3.5-4B 是一个拥有 40 亿参数的多模态大语言模型,能够同时处理图像和文本输入。它采用高效的混合架构,结合了 Gated Delta Networks 与稀疏混合专家,在保持低延迟的同时实现高吞吐推理。该模型原生支持 26 万 token 的上下文长度,并可扩展至百万级,还覆盖了 201 种语言,具备广泛的语言和文化理解能力。通过大规模强化学习训练,它在推理、代码、代理任务和视觉理解等方面表现出色。
这是一个中文句子嵌入模型,能将句子映射到768维的稠密向量空间,适用于文本匹配、语义搜索等任务。它基于MacBERT架构,使用中文语义相似度数据训练,在多个中文文本匹配基准上均表现出不错的性能。
这是一个多语言句子嵌入模型,能将句子和段落转换为384维的稠密向量,适用于文本聚类、语义搜索和句子相似度计算等任务。模型支持包括中文在内的50多种语言,基于MiniLM架构,采用均值池化方式生成句子级别的向量表示,输出可直接用于下游应用。
GLM-4.1V-9B-Thinking 是一个面向推理增强的开源视觉语言模型,基于 GLM-4-9B-0414 构建,通过引入“思考范式”与强化学习显著提升了复杂任务的准确性与完整性。该模型在 10B 参数级别的视觉语言模型中达到领先水平,在 18 项基准测试上甚至超越 72B 参数的 Qwen-2.5-VL-72B。它支持长达 64k 的上下文、任意宽高比及最高 4K 图像分辨率,并具备中英双语能力,适用于数学推理、长上下文理解及多模态智能体等应用场景。
Tongyi-MAI/Z-Image-Turbo
已完整同步
Z-Image-Turbo 是一个高效的图像生成模型,基于单流扩散 Transformer 架构,拥有 6B 参数。它通过蒸馏技术实现了仅需 8 步评估即可生成高质量图像,推理延迟可低至亚秒级,并能在 16G 显存的消费级设备上运行。该模型擅长生成逼真的图像,支持中英文双语文本渲染,且具备良好的指令跟随能力。此外,该系列还包括 Z-Image 基础模型、支持生成与编辑的 Z-Image-Omni-Base 以及专注于图像编辑的 Z-Image-Edit 等变体,覆盖了从高质量生成到精细编辑的多种场景。