数据集

39 个数据集
已选筛选: PY 清除所有筛选
LLaDA2.0-flash-preview 是一个基于扩散技术的语言模型,采用混合专家(MoE)架构,总参数量达1000亿,但推理时仅激活约61亿参数,显著降低了计算成本。它在代码生成、复杂数学推理以及工具调用等任务上表现突出,并在多个基准测试中展现出与同类开源模型相比更优的性能。该模型支持指令微调,适用于实际应用场景,未来还将通过强化学习进一步提升推理能力。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 52 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
inclusionAI/Ling-flash-2.0 已完整同步
Ling-flash-2.0 是一款基于 MoE 架构的开源语言模型,总参数量达 100B,但每次推理仅激活约 6.1B 参数(非嵌入部分 4.8B),实现了高效计算与卓越性能的平衡。该模型在 20T+ tokens 的高质量数据上训练,并经过监督微调与多阶段强化学习优化,在复杂推理、数学、代码生成和前端开发等任务中表现出色,尤其以极小的激活参数达到了与 40B 稠密模型相当的水平。推理速度上,在 H20 硬件上可达 200+ tokens/s,并支持 128K 上下文长度,兼具高吞吐与长序列处理能力。
GITATTRIBUTESJSONMDPYSAFETENSORS MIT License 192 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-V3.2-REAP-345B-A37B 是一个基于 DeepSeek-V3.2 高效压缩而来的稀疏混合专家(SMoE)语言模型。通过名为 REAP 的专家剪枝方法,模型在保留路由器对剩余专家独立控制的前提下,均匀剪除了 50% 的专家,参数量从 671B 压缩至 345B,每 token 仅激活 37B 参数。该模型在代码生成、数学推理、工具调用等任务上保持了近乎无损的性能,同时显著降低了内存占用和部署成本。它可直接兼容标准 vLLM 推理框架,无需额外修改,特别适合资源受限环境、本地部署及学术研究场景。
JSONMDPYSAFETENSORSTXT MIT License 323 GiB 87 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-V3.2-REAP-508B-A37B 是一个基于 DeepSeek-V3.2 压缩得到的稀疏混合专家语言模型。它通过 REAP(路由器加权专家激活剪枝)方法,均匀地剪除了 25% 的专家,将总参数量从 671B 压缩至 508B,而每次推理仅激活 37B 参数。该模型在代码生成、数学推理、函数调用等任务上几乎保持了与原版相同的性能,同时显著降低了内存占用和部署成本。它兼容 vLLM 等主流推理框架,无需额外修改即可直接使用,特别适合资源受限的环境和本地部署。
JSONMDPYSAFETENSORSTXT MIT License 475 GiB 119 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
XiaomiMiMo/MiMo-V2-Flash 已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT MIT License 292 GiB 157 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/DeepSeek-V3.2 可在线预览 已完整同步
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
GITATTRIBUTESJSONJSONLMDPDFPNGPYSAFETENSORSTXT MIT License 441 GiB 192 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/bge-code-v1 已完整同步
BAAI/bge-code-v1 是一个基于大语言模型的代码嵌入模型,专注于代码检索、文本检索和多语言检索。它能够用中英文自然语言查询以及 20 种编程语言进行高效代码检索,同时保持与同等规模文本嵌入模型相当的文本检索能力,并支持英语、中文、日语、法语等多种语言。该模型基于 sentence-transformers 框架,采用 Apache-2.0 许可证。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 5.8 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-v1.5-zs 已完整同步
BGE-VL是一系列面向通用多模态检索的嵌入模型,包括基于CLIP的base和large版本,以及融合多模态大语言模型的MLLM版本。这些模型借助MegaPairs数据集进行训练——该数据集通过创新的合成方法,利用开放域图像生成了超过2600万条异构KNN三元组,显著提升了多模态检索的性能。在组合图像检索等任务中,BGE-VL-MLLM模型相比此前最优方法取得了8.1%的改进。
GITATTRIBUTESJINJAJSONMDMODELPNGPYSAFETENSORS MIT License 9.5 GiB 29 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-Screenshot 已完整同步
BAAI/BGE-VL-Screenshot 是一个面向视觉化信息检索(VisIR)的模型,能将文本、图像、表格、图表等多模态信息统一表示为截图形式,实现跨模态检索。它基于 Qwen2.5-VL-3B-Instruct 构建,采用 sentence-transformers 框架,支持中英文等多种语言,并配套了大规模截图数据集 VIRA 和综合评测基准 MVRB,旨在提升检索模型在处理多模态信息时的表现。
GITATTRIBUTESJINJAJPEGJSONMDPNGPYSAFETENSORSTXT MIT License 3.5 GiB 26 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Kwai-Keye/Keye-VL-1_5-8B 已完整同步
Kwai Keye-VL-1.5 是一款前沿的多模态大语言模型,专注于视频理解与推理。它采用了创新的“慢-快”视频编码策略,通过渐进式四阶段预训练方法将上下文长度扩展至128K tokens,并设计了全面的后训练流程,以增强推理能力和对齐人类偏好。该模型在视频理解任务上表现出显著提升,同时在其他多模态基准测试中保持竞争力。
GITATTRIBUTESJPEGJSONMDPNGPYSAFETENSORSTXT Apache License 2.0 16 GiB 36 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
0xSero/GLM-4.7-185B-W4A16 已完整同步
GLM-4.7-185B-W4A16 是一个经过 4 比特权重量化(W4A16)的混合专家(MoE)模型,基于 GLM-4.7-185B 压缩而来。模型总参数量为 1850 亿,采用 INT4 权重与 FP16 激活的格式,磁盘占用约 99 GB,适用于文本生成任务。该量化版本在保持模型能力的同时显著降低了存储和推理时的显存需求。
GITATTRIBUTESJINJAJSONMDPYSAFETENSORS Apache License 2.0 92 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORS Apache License 2.0 40 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORSTXT Apache License 2.0 8.0 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
inclusionAI/Ring-2.5-1T 已完整同步
Ring-2.5-1T 是全球首个开源万亿参数思考模型,采用混合线性注意力架构。它在生成效率上通过高比例线性注意力机制,将超过32K token序列的内存访问开销降低10倍以上,生成吞吐量提升3倍多;在深度思考方面,借助密集奖励的RLVR训练,实现了IMO 2025和CMO 2025的金牌级推理水平;在长程任务执行上,经过大规模全异步智能体强化学习训练,可轻松适配Claude Code、OpenClaw等编程框架,支持复杂任务的长期自主执行。
GITATTRIBUTESJINJAJSONMDPYSAFETENSORS MIT License 396 GiB 171 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MedAIBase/AntAngelMed 已完整同步
AntAngelMed 是当前最大的开源医疗语言模型,由浙江省卫健委、蚂蚁集团及浙江省安诊儿医学人工智能科技有限公司联合研发。它在 OpenAI 的 HealthBench 和中文权威评测 MedAIBench 上均取得领先成绩,尤其在 Hard 子集上表现突出。该模型采用高效 MoE 架构,总参数 100B 但仅激活 6.1B,推理速度可达 200 tokens/s 以上,同时支持 128K 上下文长度。通过医学语料持续预训练、高质量指令微调及 GRPO 强化学习,模型具备了深入的医学知识、严谨的诊断推理能力以及良好的安全伦理遵循。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 35 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00