数据集

18 个数据集
已选筛选: BIN 清除所有筛选
L3 tmp D2 可在线预览 已完整同步
该数据集采用多种格式(bin、csv、jsonl)存储,内容涵盖模型、表格数据和结构化文本,且记录可读,便于灵活调用与分析。
BINCSVJSONL MIT License 149 B 4 个文件 WeHub 同步于 2026-09-03 12:20:44 +00:00
L3 tmp D4 可在线预览 已完整同步
这份数据集以 L3 tmp D4 为标题,提供 CSV 与二进制(bin)两种格式,内容涵盖表格型数据与模型。数据记录可读,便于直接使用与分析。
BINCSV MIT License 5.1 KiB 4 个文件 WeHub 同步于 2026-09-03 12:10:54 +00:00
L3 tmp D1 可在线预览 已完整同步
这是一个名为“L3 tmp D1”的数据集,包含二进制、CSV 和 JSONL 三种格式,覆盖模型、表格和结构化文本三类内容。数据集中的记录可读,便于直接使用。
BINCSVJSONL MIT License 124 B 3 个文件 WeHub 同步于 2026-09-03 12:10:49 +00:00
CAM++ 说话人确认模型基于密集连接时延神经网络,专为中文通用场景设计,在约 200k 说话人的大规模数据集上训练而成。该模型在说话人识别任务中兼顾高性能与高效率,相比主流模型(如 ResNet34、ECAPA-TDNN)在准确率与推理速度上均有优势,可广泛用于说话人确认、说话人日志、语音合成及说话人风格转换等场景。
BINGITATTRIBUTESJSONMDPNGTXTWAVYAML Apache License 2.0 28 MiB 12 个文件 WeHub 同步于 2026-08-30 00:33:31 +00:00
BAAI/bge-small-en-v1.5 已完整同步
这是一个轻量级的英文句子嵌入模型,属于bge系列,能够将文本转换为向量表示,适用于特征提取、句子相似度计算和语义搜索等任务。它在多个自然语言处理基准测试中表现出色,涵盖分类、检索、聚类、重排序和语义文本相似度等场景,兼顾了效率与性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXT MIT License 382 MiB 14 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
BERT base uncased是一个基于Transformer架构的预训练语言模型,通过掩码语言建模和下一句预测两个自监督任务,在大规模英文语料上学习到了丰富的语言表示。该模型不区分大小写,拥有约1.1亿参数,适用于多种自然语言处理下游任务的微调,如文本分类、问答和命名实体识别等。
BINGITATTRIBUTESH5JSONMDMLMODELMSGPACKONNXOTSAFETENSORSTXT Apache License 2.0 3.2 GiB 16 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
这是一个中文句子嵌入模型,基于CoSENT方法训练,能够将句子映射为768维的稠密向量,适用于语义相似度计算、文本匹配和语义搜索等任务。模型在多个中文语义评测数据集上取得了较好的表现。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
这是一个中文句子嵌入模型,能将句子映射到768维的稠密向量空间,适用于文本匹配、语义搜索等任务。它基于MacBERT架构,使用中文语义相似度数据训练,在多个中文文本匹配基准上均表现出不错的性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-19 13:05:10 +00:00
这是一个多语言句子嵌入模型,能将句子和段落转换为384维的稠密向量,适用于文本聚类、语义搜索和句子相似度计算等任务。模型支持包括中文在内的50多种语言,基于MiniLM架构,采用均值池化方式生成句子级别的向量表示,输出可直接用于下游应用。
BINGITATTRIBUTESH5JSONMDMODELONNXSAFETENSORSXML Apache License 2.0 4.3 GiB 28 个文件 WeHub 同步于 2026-08-19 12:47:07 +00:00
这是一个基于 MiniLM-L6 架构的 Cross-Encoder 模型,专门针对 MS Marco 段落排序任务训练而成。它主要用于信息检索中的重排序阶段:给定一个查询,先通过检索工具(如 ElasticSearch)召回一批候选段落,再用该模型对每个查询‑段落对进行相关性打分,最后按分数降序排列,以提升排序质量。模型可通过 SentenceTransformers 或 Transformers 库直接调用,输入查询和段落文本,即可输出相关性分数。在 TREC Deep Learning 2019 和 MS Marco 开发集上,它均取得了较好的排序效果,兼顾了速度与准确度。
BINGITATTRIBUTESJSONMDMSGPACKONNXSAFETENSORSTXTXML Apache License 2.0 849 MiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ASLP-lab/DiffRhythm2 已完整同步
DiffRhythm 2 是新一代开源音乐生成框架,基于半自回归扩散架构,能够生成完整歌曲,并实现精确的歌词对齐与连贯的音乐结构。其名称中的“Diff”代表扩散生成主干,“Rhythm”强调对音乐性与时间流动的专注,中文名“谛韵”则融合了“谛”(专注聆听)与“韵”(旋律魅力)的双重寓意。
BINGITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 4.7 GiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/Janus-Pro-7B 已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
BINGITATTRIBUTESJSONMDPNG MIT License 14 GiB 13 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Wan-AI/Wan2.2-S2V-14B 已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
BINBINARYGITATTRIBUTESJSONMDMODELMP4MSCMSGPACKMVPNGPTHPYSAFETENSORSSHTXT Apache License 2.0 46 GiB 49 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ByteDance/Q-Insight 已完整同步
Q-Insight 是一个专注于图像质量理解的视觉语言模型,通过视觉强化学习进行训练。它基于 Qwen2.5-VL-7B-Instruct 进行微调,采用 Apache-2.0 开源协议。该模型主要面向图像质量评估(IQA)、视频质量评估(VQA)以及 AIGC 内容的理解任务。
BINGITATTRIBUTESJSONMDNPZPKLPTSAFETENSORSTXT Apache License 2.0 80 GiB 92 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/Video-XL-2 已完整同步
Video-XL-2 是一个支持视频与文本交互的多模态模型,能够根据视频内容回答用户的问题。它针对长视频场景提供了两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层 KV 缓存解码(bi-level kvs decoding),可以有效降低显存占用和响应延迟,适合处理较长视频的推理任务。
BINGITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 15 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
BINGITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSSVG MIT License 99 GiB 34 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SparkAudio/Spark-TTS-0.5B 已完整同步
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。
BINGITATTRIBUTESJPGJSONMDPNGSAFETENSORSTXTYAML Apache License 2.0 3.7 GiB 31 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00