数据集

9 个数据集
已选筛选: ONNX 清除所有筛选
FSMN语音端点检测(VAD)模型专为中文通用场景设计,支持16kHz采样率的音频输入。该模型基于FSMN架构,已导出为ONNX量化格式,便于在生产环境中直接部署,实现高效的语音活性检测。它能够准确判断音频中语音段的起止位置,适用于实时或离线语音识别等任务。
GITATTRIBUTESJSONMDMVNONNXYAML Apache License 2.0 511 KiB 7 个文件 WeHub 同步于 2026-08-20 02:05:54 +00:00
BAAI/bge-small-en-v1.5 已完整同步
这是一个轻量级的英文句子嵌入模型,属于bge系列,能够将文本转换为向量表示,适用于特征提取、句子相似度计算和语义搜索等任务。它在多个自然语言处理基准测试中表现出色,涵盖分类、检索、聚类、重排序和语义文本相似度等场景,兼顾了效率与性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXT MIT License 382 MiB 14 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
BERT base uncased是一个基于Transformer架构的预训练语言模型,通过掩码语言建模和下一句预测两个自监督任务,在大规模英文语料上学习到了丰富的语言表示。该模型不区分大小写,拥有约1.1亿参数,适用于多种自然语言处理下游任务的微调,如文本分类、问答和命名实体识别等。
BINGITATTRIBUTESH5JSONMDMLMODELMSGPACKONNXOTSAFETENSORSTXT Apache License 2.0 3.2 GiB 16 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
这是一个中文句子嵌入模型,基于CoSENT方法训练,能够将句子映射为768维的稠密向量,适用于语义相似度计算、文本匹配和语义搜索等任务。模型在多个中文语义评测数据集上取得了较好的表现。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
这是一个中文句子嵌入模型,能将句子映射到768维的稠密向量空间,适用于文本匹配、语义搜索等任务。它基于MacBERT架构,使用中文语义相似度数据训练,在多个中文文本匹配基准上均表现出不错的性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-19 13:05:10 +00:00
这是一个多语言句子嵌入模型,能将句子和段落转换为384维的稠密向量,适用于文本聚类、语义搜索和句子相似度计算等任务。模型支持包括中文在内的50多种语言,基于MiniLM架构,采用均值池化方式生成句子级别的向量表示,输出可直接用于下游应用。
BINGITATTRIBUTESH5JSONMDMODELONNXSAFETENSORSXML Apache License 2.0 4.3 GiB 28 个文件 WeHub 同步于 2026-08-19 12:47:07 +00:00
这是一个基于 MiniLM-L6 架构的 Cross-Encoder 模型,专门针对 MS Marco 段落排序任务训练而成。它主要用于信息检索中的重排序阶段:给定一个查询,先通过检索工具(如 ElasticSearch)召回一批候选段落,再用该模型对每个查询‑段落对进行相关性打分,最后按分数降序排列,以提升排序质量。模型可通过 SentenceTransformers 或 Transformers 库直接调用,输入查询和段落文本,即可输出相关性分数。在 TREC Deep Learning 2019 和 MS Marco 开发集上,它均取得了较好的排序效果,兼顾了速度与准确度。
BINGITATTRIBUTESJSONMDMSGPACKONNXSAFETENSORSTXTXML Apache License 2.0 849 MiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
BINGITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSSVG MIT License 99 GiB 34 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Fun-CosyVoice 3.0 是一个基于大语言模型的先进文本转语音(TTS)系统,在内容一致性、说话人相似度和韵律自然度上均超越前代。它支持9种常见语言(中、英、日、韩、德、西、法、意、俄)以及18种以上中文方言/口音,同时具备跨语言零样本语音克隆能力。系统还提供发音修复、文本标准化、低延迟流式输出和指令控制(如语言、情感、语速、音量)等实用功能,适合生产环境使用。
GITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSTXTYAML Apache License 2.0 9.1 GiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00