数据集

242 个数据集
CASIA-LM/OpenS2S_Datasets 可在线预览 已完整同步
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
0123456GITATTRIBUTESGZJSONLMD Apache License 2.0 70 GiB 19 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
inclusionAI/Ling-flash-2.0 已完整同步
Ling-flash-2.0 是一款基于 MoE 架构的开源语言模型,总参数量达 100B,但每次推理仅激活约 6.1B 参数(非嵌入部分 4.8B),实现了高效计算与卓越性能的平衡。该模型在 20T+ tokens 的高质量数据上训练,并经过监督微调与多阶段强化学习优化,在复杂推理、数学、代码生成和前端开发等任务中表现出色,尤其以极小的激活参数达到了与 40B 稠密模型相当的水平。推理速度上,在 H20 硬件上可达 200+ tokens/s,并支持 128K 上下文长度,兼具高吞吐与长序列处理能力。
GITATTRIBUTESJSONMDPYSAFETENSORS MIT License 192 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-V3.2-REAP-345B-A37B 是一个基于 DeepSeek-V3.2 高效压缩而来的稀疏混合专家(SMoE)语言模型。通过名为 REAP 的专家剪枝方法,模型在保留路由器对剩余专家独立控制的前提下,均匀剪除了 50% 的专家,参数量从 671B 压缩至 345B,每 token 仅激活 37B 参数。该模型在代码生成、数学推理、工具调用等任务上保持了近乎无损的性能,同时显著降低了内存占用和部署成本。它可直接兼容标准 vLLM 推理框架,无需额外修改,特别适合资源受限环境、本地部署及学术研究场景。
JSONMDPYSAFETENSORSTXT MIT License 323 GiB 87 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-V3.2-REAP-508B-A37B 是一个基于 DeepSeek-V3.2 压缩得到的稀疏混合专家语言模型。它通过 REAP(路由器加权专家激活剪枝)方法,均匀地剪除了 25% 的专家,将总参数量从 671B 压缩至 508B,而每次推理仅激活 37B 参数。该模型在代码生成、数学推理、函数调用等任务上几乎保持了与原版相同的性能,同时显著降低了内存占用和部署成本。它兼容 vLLM 等主流推理框架,无需额外修改即可直接使用,特别适合资源受限的环境和本地部署。
JSONMDPYSAFETENSORSTXT MIT License 475 GiB 119 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
XiaomiMiMo/MiMo-V2-Flash 已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT MIT License 292 GiB 157 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
BINGITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSSVG MIT License 99 GiB 34 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
microsoft/TRELLIS.2-4B 已完整同步
TRELLIS.2-4B 是一个面向图像到 3D 生成的大规模模型,拥有 40 亿参数。它基于一种名为 O-Voxel 的新型稀疏体素结构,能够直接从单张图像重建或生成任意拓扑的 3D 资产,并带有完整的物理渲染(PBR)材质,包括透明与半透明效果。该模型支持最高 1536³ 分辨率的高质量输出,并采用流匹配变换器架构,生成速度快、潜空间紧凑。
GITATTRIBUTESJSONMDSAFETENSORS MIT License 15 GiB 22 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cloudcatcher2/VCBench 已完整同步
VCBench 是一个标准化的视觉语言模型评估框架,专注于数学领域的问答任务。该数据集提供了标准评估和 GPT 辅助评估两种方式,帮助用户衡量模型在单选题和自然语言回答上的表现。评估脚本会输出整体准确率以及按问题类型细分的准确率,方便用户深入分析模型能力。
GITATTRIBUTESJSONMDPNG Apache License 2.0 99 MiB 8423 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LIFEBench/LIFEBench 可在线预览 已完整同步
LIFEBench是一个专门用于评估大语言模型遵循长度指令能力的综合基准数据集。它包含英文和中文两种语言,覆盖问答、摘要、文本生成等多种任务,长度约束范围从16个单词到8192个单词不等。数据集提供了多个子集(如主集、标签集、精简集和重构集),方便不同场景下的评估。通过分析多个主流模型,该数据集发现大多数模型在短长度指令上表现良好,但超过一定长度后性能急剧下降,揭示了当前大语言模型在长度遵循方面的根本性局限。
GITATTRIBUTESJSONLMDPARQUETPNG MIT License 15 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
yu0226/CipherBank 可在线预览 已完整同步
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。
GITATTRIBUTESJSONLMD Apache License 2.0 944 KiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Skywork/Matrix-Game-2.0 已完整同步
Matrix-Game-2.0 是一个开源的实时交互式世界模型,基于扩散架构实现高效的流式视频生成。它能够以 25 FPS 的速度实时合成分钟级的高保真视频,并支持通过鼠标和键盘精确控制画面内容,实现帧级别的动态响应。该模型从视觉内容和用户动作直接预测后续帧,无需文本输入,在多种复杂场景下均表现出色。
GITATTRIBUTESJSONMDMODELPNGPTHSAFETENSORS MIT License 26 GiB 18 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
M3-Agent-Control 是一个面向智能体控制任务的数据集,采用 Apache-2.0 许可证。数据集包含模型权重(以 safetensors 格式存储)、结构化文本、二进制数据及纯文本等多种内容类型,适用于相关领域的模型训练与评估。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 51 GiB 26 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
VeriWeb 是面向智能体信息检索的可验证长链网页任务基准,用于评估智能体在网页环境中的搜索、证据获取和结果验证能力。
GITATTRIBUTESJSONMDMP4PNG Apache License 2.0 80 GiB 609 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
TimesFM 是一个预训练的时间序列基础模型,专为时间序列预测任务设计。它采用仅解码器架构,在多种数据上进行了预训练,包括合成和增强数据。该模型支持 PyTorch 框架,能够处理最大上下文长度为1024、最大预测步长为256的时间序列,并提供输入归一化、连续分位数预测、翻转不变性等功能,适用于多种预测场景。
GITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 882 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/Qwen3.5-397B-A17B 已完整同步
Qwen3.5-397B-A17B是一个大规模多模态语言模型,总参数量达3970亿,每个token仅激活约170亿参数。它采用高效的混合架构,融合Gated Delta Networks与稀疏混合专家(MoE),在视觉理解、推理、编码和智能体等任务上表现优异。该模型原生支持26万tokens上下文长度,并可扩展至百万级,同时覆盖201种语言,具备强大的多语言能力。通过扩展规模的强化学习训练和接近100%的多模态训练效率,它在保持高性能的同时实现了较低的推理成本。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 437 GiB 107 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HuiZhang0812/CreatiDesign_dataset 可在线预览 已完整同步
这是一个用于多条件图形设计生成的大规模高质量数据集,包含约40万个合成样本。每个样本都带有丰富的多条件标注,涵盖主要视觉元素、次要视觉元素(附带空间与语义信息)以及文本元素(如标语或标题的布局信息)。该数据集适用于文本到图像生成等任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 162 GiB 52 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/DeepSeek-V3.2 可在线预览 已完整同步
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
GITATTRIBUTESJSONJSONLMDPDFPNGPYSAFETENSORSTXT MIT License 441 GiB 192 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/bge-code-v1 已完整同步
BAAI/bge-code-v1 是一个基于大语言模型的代码嵌入模型,专注于代码检索、文本检索和多语言检索。它能够用中英文自然语言查询以及 20 种编程语言进行高效代码检索,同时保持与同等规模文本嵌入模型相当的文本检索能力,并支持英语、中文、日语、法语等多种语言。该模型基于 sentence-transformers 框架,采用 Apache-2.0 许可证。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 5.8 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-v1.5-zs 已完整同步
BGE-VL是一系列面向通用多模态检索的嵌入模型,包括基于CLIP的base和large版本,以及融合多模态大语言模型的MLLM版本。这些模型借助MegaPairs数据集进行训练——该数据集通过创新的合成方法,利用开放域图像生成了超过2600万条异构KNN三元组,显著提升了多模态检索的性能。在组合图像检索等任务中,BGE-VL-MLLM模型相比此前最优方法取得了8.1%的改进。
GITATTRIBUTESJINJAJSONMDMODELPNGPYSAFETENSORS MIT License 9.5 GiB 29 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00