数据集

45 个数据集
已选筛选: MD apache-2.0 模型 清除所有筛选
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 3.8 MiB 8 个文件 WeHub 同步于 2026-08-29 21:03:42 +00:00
这是一个基于CT-Transformer架构的中文标点预测模型,适用于语音识别结果的后处理或纯文本输入的标点添加。它通过可控时延技术,在保持模型性能的同时有效降低了标点预测的延迟,能够在通用中文场景下输出具有可读性的文本。
GITATTRIBUTESJSONMDPNGPTTXTYAML Apache License 2.0 283 MiB 9 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 868 MiB 11 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
FSMN语音端点检测(VAD)模型专为中文通用场景设计,支持16kHz采样率的音频输入。该模型基于FSMN架构,已导出为ONNX量化格式,便于在生产环境中直接部署,实现高效的语音活性检测。它能够准确判断音频中语音段的起止位置,适用于实时或离线语音识别等任务。
GITATTRIBUTESJSONMDMVNONNXYAML Apache License 2.0 511 KiB 7 个文件 WeHub 同步于 2026-08-20 02:05:54 +00:00
Qwen3-30B-A3B-Thinking-2507 是一个基于 Transformer 的因果语言模型,采用混合专家(MoE)架构,总参数量为 30.5B,每次推理仅激活 3.3B 参数。它原生支持高达 262K 的上下文长度,在逻辑推理、数学、科学、编程等复杂推理任务上表现显著提升,同时指令遵循、工具使用、文本生成等通用能力也有明显增强。该模型默认开启深度思考模式,特别适合处理高复杂度的推理场景。
GITATTRIBUTESJSONMDSAFETENSORSTXT Apache License 2.0 57 GiB 27 个文件 WeHub 同步于 2026-08-20 02:03:47 +00:00
BERT base uncased是一个基于Transformer架构的预训练语言模型,通过掩码语言建模和下一句预测两个自监督任务,在大规模英文语料上学习到了丰富的语言表示。该模型不区分大小写,拥有约1.1亿参数,适用于多种自然语言处理下游任务的微调,如文本分类、问答和命名实体识别等。
BINGITATTRIBUTESH5JSONMDMLMODELMSGPACKONNXOTSAFETENSORSTXT Apache License 2.0 3.2 GiB 16 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
这是一个中文句子嵌入模型,基于CoSENT方法训练,能够将句子映射为768维的稠密向量,适用于语义相似度计算、文本匹配和语义搜索等任务。模型在多个中文语义评测数据集上取得了较好的表现。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
Qwen/Qwen3.5-4B 已完整同步
Qwen3.5-4B 是一个拥有 40 亿参数的多模态大语言模型,能够同时处理图像和文本输入。它采用高效的混合架构,结合了 Gated Delta Networks 与稀疏混合专家,在保持低延迟的同时实现高吞吐推理。该模型原生支持 26 万 token 的上下文长度,并可扩展至百万级,还覆盖了 201 种语言,具备广泛的语言和文化理解能力。通过大规模强化学习训练,它在推理、代码、代理任务和视觉理解等方面表现出色。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 8.7 GiB 14 个文件 WeHub 同步于 2026-08-19 14:32:57 +00:00
这是一个中文句子嵌入模型,能将句子映射到768维的稠密向量空间,适用于文本匹配、语义搜索等任务。它基于MacBERT架构,使用中文语义相似度数据训练,在多个中文文本匹配基准上均表现出不错的性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-19 13:05:10 +00:00
这是一个多语言句子嵌入模型,能将句子和段落转换为384维的稠密向量,适用于文本聚类、语义搜索和句子相似度计算等任务。模型支持包括中文在内的50多种语言,基于MiniLM架构,采用均值池化方式生成句子级别的向量表示,输出可直接用于下游应用。
BINGITATTRIBUTESH5JSONMDMODELONNXSAFETENSORSXML Apache License 2.0 4.3 GiB 28 个文件 WeHub 同步于 2026-08-19 12:47:07 +00:00
Tongyi-MAI/Z-Image-Turbo 已完整同步
Z-Image-Turbo 是一个高效的图像生成模型,基于单流扩散 Transformer 架构,拥有 6B 参数。它通过蒸馏技术实现了仅需 8 步评估即可生成高质量图像,推理延迟可低至亚秒级,并能在 16G 显存的消费级设备上运行。该模型擅长生成逼真的图像,支持中英文双语文本渲染,且具备良好的指令跟随能力。此外,该系列还包括 Z-Image 基础模型、支持生成与编辑的 Z-Image-Omni-Base 以及专注于图像编辑的 Z-Image-Edit 等变体,覆盖了从高质量生成到精细编辑的多种场景。
GITATTRIBUTESJPGJSONMDPDFPNGSAFETENSORSTXTWEBP Apache License 2.0 31 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个基于 MiniLM-L6 架构的 Cross-Encoder 模型,专门针对 MS Marco 段落排序任务训练而成。它主要用于信息检索中的重排序阶段:给定一个查询,先通过检索工具(如 ElasticSearch)召回一批候选段落,再用该模型对每个查询‑段落对进行相关性打分,最后按分数降序排列,以提升排序质量。模型可通过 SentenceTransformers 或 Transformers 库直接调用,输入查询和段落文本,即可输出相关性分数。在 TREC Deep Learning 2019 和 MS Marco 开发集上,它均取得了较好的排序效果,兼顾了速度与准确度。
BINGITATTRIBUTESJSONMDMSGPACKONNXSAFETENSORSTXTXML Apache License 2.0 849 MiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
zai-org/CogVideoX-2b 已完整同步
CogVideoX-2B 是一个文本到视频的生成模型,能够根据英文描述生成连贯的视频内容。该模型采用 Apache-2.0 开源许可证,适用于视频生成相关的研究和应用。
GITATTRIBUTESGITIGNOREJSONMDMODELSAFETENSORS Apache License 2.0 13 GiB 19 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Ming-UniAudio 是一个统一的语音理解、生成与编辑框架,其核心创新在于提出了一种基于 VAE 架构的连续语音分词器,首次将语义与声学特征有效融合,使同一个语言模型既能理解语音也能生成语音。在此基础上,该模型通过扩散头增强生成保真度,并进一步训练出首个仅凭自然语言指令即可完成自由形式语音编辑的模型,无需人工指定待编辑区域,支持复杂的语义和声学修改。
GITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 34 GiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ASLP-lab/DiffRhythm2 已完整同步
DiffRhythm 2 是新一代开源音乐生成框架,基于半自回归扩散架构,能够生成完整歌曲,并实现精确的歌词对齐与连贯的音乐结构。其名称中的“Diff”代表扩散生成主干,“Rhythm”强调对音乐性与时间流动的专注,中文名“谛韵”则融合了“谛”(专注聆听)与“韵”(旋律魅力)的双重寓意。
BINGITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 4.7 GiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/VoxCPM1.5 已完整同步
VoxCPM1.5 是一个无需分词器的文本转语音(TTS)系统,能够生成上下文感知、富有表现力的语音,并实现逼真的零样本声音克隆。该模型基于 MiniCPM4-0.5B,采用扩散自回归架构直接生成连续语音表示,在 180 万小时双语语料上训练。相比前代版本,它支持 44.1kHz 高采样率输出,提高了音质,同时将 token 率降至 6.25Hz,提升效率。支持流式合成,实时因子低至 0.17,并可通过 SFT 或 LoRA 进行微调,适配个性化语音模型。
GITATTRIBUTESJSONMDPNGPTHSAFETENSORS Apache License 2.0 1.8 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZhejiangLab/Gengram 已完整同步
Gengram-10B 是一个为基因组基础模型设计的条件记忆模块,通过显式基序记忆检索增强基于 Transformer 的 DNA 序列建模。它采用哈希查找表存储和检索 k-mer(k=1-6),并引入 21 碱基对窗口机制以对齐 DNA 螺旋结构,在保持线性时间复杂度的同时提升计算效率。该模块兼容多种注意力机制(如 MHA、GQA、MLA),支持混合专家模型中的负载均衡,并具备生物可解释性:记忆嵌入呈现反向互补对称性,门控机制随功能区域变化,从浅层到深层形成层次化表示。
DISTCPGITATTRIBUTESJSONMDMETADATAPTTXT Apache License 2.0 145 GiB 1033 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-SALA 已完整同步
MiniCPM-SALA是一种创新的大规模混合注意力模型,首次将稀疏注意力与线性注意力高效融合,专为百万级令牌的上下文建模设计。它采用25%的稀疏注意力层(基于InfLLM-v2)和75%的线性注意力层(Lightning Attention),在保持高保真长上下文建模能力的同时,突破了计算和内存瓶颈,实现了3.5倍的推理加速,并显著降低KV缓存开销。通过混合位置编码(HyPE)和基于蒸馏的HALO训练策略,该模型能够扩展到百万令牌以上的上下文长度,同时在通用知识、数学和代码等任务上保持与全注意力模型相当的性能。
GITATTRIBUTESJSONMDMODELPYSAFETENSORS Apache License 2.0 18 GiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PKU-DS-LAB/FairyR1-32B 已完整同步
FairyR1-32B 是一个高效的大语言模型,由北京大学 DS-LAB 团队开发。它基于 DeepSeek‑R1‑Distill‑Qwen‑32B 构建,采用创新的“蒸馏-融合”流程,仅用约 5% 的参数规模,便在数学竞赛(如 AIME 2024/2025)和代码生成(如 LiveCodeBench)等任务上取得了与 DeepSeek‑R1‑671B 相当甚至更优的成绩。该模型通过优化数据蒸馏管道和多专家模型融合,在显著降低推理成本的同时,保持了出色的任务性能。
GITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 61 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-V-4_5 已完整同步
MiniCPM-V 4.5 是一款基于 Qwen3-8B 和 SigLIP2-400M 构建的多模态大语言模型,总参数量为 8B。它在视觉语言能力上表现出色,在多项基准测试中平均得分超过 GPT-4o-latest 等主流模型,并支持高效的高帧率视频理解,通过 3D 重采样器实现 96 倍视频 token 压缩。该模型具备可控的快速与深度思考模式切换,以及强大的 OCR、文档解析和多语言处理能力,支持最高 1.8 百万像素的高分辨率图像输入,并提供了多种量化与推理方式以适配不同使用场景。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 16 GiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00