数据集

11 个数据集
已选筛选: TXT MIT 清除所有筛选
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
GITATTRIBUTESGITIGNOREJSONMDMODELPTPYSAFETENSORSTXTYAML MIT License 40 GiB 64 个文件 WeHub 同步于 2026-08-28 10:58:25 +00:00
BAAI/bge-small-en-v1.5 已完整同步
这是一个轻量级的英文句子嵌入模型,属于bge系列,能够将文本转换为向量表示,适用于特征提取、句子相似度计算和语义搜索等任务。它在多个自然语言处理基准测试中表现出色,涵盖分类、检索、聚类、重排序和语义文本相似度等场景,兼顾了效率与性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXT MIT License 382 MiB 14 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
DeepSeek-V3.2-REAP-345B-A37B 是一个基于 DeepSeek-V3.2 高效压缩而来的稀疏混合专家(SMoE)语言模型。通过名为 REAP 的专家剪枝方法,模型在保留路由器对剩余专家独立控制的前提下,均匀剪除了 50% 的专家,参数量从 671B 压缩至 345B,每 token 仅激活 37B 参数。该模型在代码生成、数学推理、工具调用等任务上保持了近乎无损的性能,同时显著降低了内存占用和部署成本。它可直接兼容标准 vLLM 推理框架,无需额外修改,特别适合资源受限环境、本地部署及学术研究场景。
JSONMDPYSAFETENSORSTXT MIT License 323 GiB 87 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-V3.2-REAP-508B-A37B 是一个基于 DeepSeek-V3.2 压缩得到的稀疏混合专家语言模型。它通过 REAP(路由器加权专家激活剪枝)方法,均匀地剪除了 25% 的专家,将总参数量从 671B 压缩至 508B,而每次推理仅激活 37B 参数。该模型在代码生成、数学推理、函数调用等任务上几乎保持了与原版相同的性能,同时显著降低了内存占用和部署成本。它兼容 vLLM 等主流推理框架,无需额外修改即可直接使用,特别适合资源受限的环境和本地部署。
JSONMDPYSAFETENSORSTXT MIT License 475 GiB 119 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
XiaomiMiMo/MiMo-V2-Flash 已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT MIT License 292 GiB 157 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/DeepSeek-V3.2 可在线预览 已完整同步
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
GITATTRIBUTESJSONJSONLMDPDFPNGPYSAFETENSORSTXT MIT License 441 GiB 192 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-Screenshot 已完整同步
BAAI/BGE-VL-Screenshot 是一个面向视觉化信息检索(VisIR)的模型,能将文本、图像、表格、图表等多模态信息统一表示为截图形式,实现跨模态检索。它基于 Qwen2.5-VL-3B-Instruct 构建,采用 sentence-transformers 框架,支持中英文等多种语言,并配套了大规模截图数据集 VIRA 和综合评测基准 MVRB,旨在提升检索模型在处理多模态信息时的表现。
GITATTRIBUTESJINJAJPEGJSONMDPNGPYSAFETENSORSTXT MIT License 3.5 GiB 26 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HiDream-ai/HiDream-E1-Full 已完整同步
HiDream-E1 是一个基于指令驱动的图像编辑模型,能够根据用户提供的自然语言描述对输入图像进行编辑。它支持灵活的编辑指令格式,例如“将图片转换为吉卜力风格”,并配合目标图像描述来精确控制输出效果。该模型结合了 Llama 3.1 文本编码器与扩散 Transformer 架构,可在保持图像整体结构的同时实现多样化的风格转换和内容修改。
GITATTRIBUTESJPGJSONMDMODELSAFETENSORSTXT MIT License 44 GiB 37 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
showlab/OmniConsistency 可在线预览 已完整同步
OmniConsistency 是一个大规模的多风格图像翻译数据集,包含了 22 种独特的艺术风格。每种风格都提供了对齐的图像对:原始图像(如照片或线稿)和对应的风格化图像,并附带描述该艺术风格的文本提示。该数据集适用于风格迁移、图像到图像生成、基于提示的条件生成以及一致性学习等任务。
GITATTRIBUTESJSONLMDPARQUETPNGTXT MIT License 7.4 GiB 7861 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00