数据集

142 个数据集
已选筛选: MD apache-2.0 清除所有筛选
Fun-CosyVoice 3.0 是一个基于大语言模型的先进文本转语音(TTS)系统,在内容一致性、说话人相似度和韵律自然度上均超越前代。它支持9种常见语言(中、英、日、韩、德、西、法、意、俄)以及18种以上中文方言/口音,同时具备跨语言零样本语音克隆能力。系统还提供发音修复、文本标准化、低延迟流式输出和指令控制(如语言、情感、语速、音量)等实用功能,适合生产环境使用。
GITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSTXTYAML Apache License 2.0 9.1 GiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
0xSero/GLM-4.7-185B-W4A16 已完整同步
GLM-4.7-185B-W4A16 是一个经过 4 比特权重量化(W4A16)的混合专家(MoE)模型,基于 GLM-4.7-185B 压缩而来。模型总参数量为 1850 亿,采用 INT4 权重与 FP16 激活的格式,磁盘占用约 99 GB,适用于文本生成任务。该量化版本在保持模型能力的同时显著降低了存储和推理时的显存需求。
GITATTRIBUTESJINJAJSONMDPYSAFETENSORS Apache License 2.0 92 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LongCat-Image 是一个开源的、中英双语的图像生成基础模型,拥有60亿参数。它在保持高效性能的同时,在多个基准测试中超越了数倍于自身规模的模型,尤其擅长中文文字渲染,能准确稳定地生成常见汉字,并覆盖了广泛的汉字字典。此外,该模型通过创新的数据策略和训练框架,能够生成具有出色照片级真实感的图像。
GITATTRIBUTESJPEGJPGJSONMDSAFETENSORSSVGTXT Apache License 2.0 27 GiB 36 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORS Apache License 2.0 40 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORSTXT Apache License 2.0 8.0 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Nanbeige/Nanbeige4.1-3B 已完整同步
Nanbeige4.1-3B 是基于 Nanbeige4-3B-Base 构建的轻量级推理模型,通过监督微调与强化学习进一步优化,在保持小参数规模的同时展现出强大的推理能力、偏好对齐效果和智能体行为。它能够通过单次前向传播完成复杂多步推理,并在代码、数学、科学等多项基准测试中超越同规模及部分更大模型。此外,Nanbeige4.1-3B 原生支持深度搜索任务,可稳定执行超过 500 轮工具调用,填补了小型模型在通用推理与智能体场景中兼顾不足的空白。
GITATTRIBUTESJSONMDMODELPDFPNGSAFETENSORS Apache License 2.0 7.3 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
nari-labs/Dia-1.6B 已完整同步
Dia是一个拥有1.6B参数的文本到语音模型,能够直接从脚本生成高度逼真的对话。它支持通过音频条件控制情感和语调,还能输出笑声、咳嗽等非语言声音。目前仅支持英文生成。
GITATTRIBUTESJSONMDPTHSAFETENSORS Apache License 2.0 12 GiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenBuddy/R1-0528-Distill 可在线预览 已完整同步
OpenBuddy/R1-0528-Distill 是一个包含多种格式的数据集,主要采用 JSONL 格式,同时包含 Git 属性文件和 Markdown 文档。其内容涵盖结构化文本、纯文本以及二进制数据,适合用于语言模型的蒸馏训练或相关研究。
GITATTRIBUTESJSONLMD Apache License 2.0 384 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PG23/Mobile-R1 可在线预览 已完整同步
Mobile-R1 是一个面向移动端 GUI 代理的中文轨迹数据集,包含从用户指令到完整交互过程的记录。每个样本由应用名称、指令文本、系统提示和一系列操作步骤组成,步骤中保存了对应屏幕截图、模型推理、子任务描述以及具体的执行动作(如点击、滑动、输入、等待等),并标注了屏幕尺寸用于坐标对齐。该数据集可用于训练和评估多模态模型在真实手机界面上的任务理解与操作生成能力。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 7.8 GiB 3927 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xai-org/grok-1 已完整同步
Grok-1 是一个基于 Apache-2.0 许可证开源的文本生成模型,拥有 3140 亿参数。该模型提供了开放权重,适用于多 GPU 环境下的推理。由于参数量巨大,运行需要配备多块 GPU 的机器。
GITATTRIBUTESMD Apache License 2.0 156 GiB 773 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/QwQ-32B 已完整同步
QwQ-32B是Qwen系列中的推理模型,拥有32.5B参数,基于Transformer架构,支持最长131,072 tokens的上下文。它经过预训练、监督微调与强化学习,具备深度思考与推理能力,在复杂任务上表现优异,可对标业界领先的推理模型。
GITATTRIBUTESJPGJSONMDSAFETENSORSTXT Apache License 2.0 57 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Lk123/InfoSeek 可在线预览 已完整同步
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
GITATTRIBUTESJSONLMD Apache License 2.0 396 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SparkAudio/Spark-TTS-0.5B 已完整同步
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。
BINGITATTRIBUTESJPGJSONMDPNGSAFETENSORSTXTYAML Apache License 2.0 3.7 GiB 31 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MedAIBase/AntAngelMed 已完整同步
AntAngelMed 是当前最大的开源医疗语言模型,由浙江省卫健委、蚂蚁集团及浙江省安诊儿医学人工智能科技有限公司联合研发。它在 OpenAI 的 HealthBench 和中文权威评测 MedAIBench 上均取得领先成绩,尤其在 Hard 子集上表现突出。该模型采用高效 MoE 架构,总参数 100B 但仅激活 6.1B,推理速度可达 200 tokens/s 以上,同时支持 128K 上下文长度。通过医学语料持续预训练、高质量指令微调及 GRPO 强化学习,模型具备了深入的医学知识、严谨的诊断推理能力以及良好的安全伦理遵循。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 35 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
jetmoe/jetmoe-8b 已完整同步
JetMoE-8B 是一个高效的大语言模型,仅需极低的训练成本就能达到甚至超越 LLaMA2-7B 的性能。它在推理时只有 2.2B 活跃参数,大幅降低了计算开销,同时优于计算量相近的模型(如 Gemma-2B)。该模型完全基于公开数据集训练,代码开源,便于在普通消费级 GPU 上进行微调,适合学术研究场景。
GITATTRIBUTESJSONMDMODELPNGSAFETENSORS Apache License 2.0 16 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenAssistant/oasst1 可在线预览 已完整同步
这是一个大规模、多语言的对话数据集,由13,500多名志愿者众包构建而成。其中包含超过16万条人类编写的助手式对话消息,覆盖35种语言,并附有超过46万条质量评分。数据以对话树形式组织,每条消息包含角色(助手或提示者)、语言、审核结果、标签以及毒性评估等丰富字段,可用于训练和评估对话模型的对齐能力。
GITATTRIBUTESGZMDPARQUET Apache License 2.0 221 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
GITATTRIBUTESJSONMD Apache License 2.0 236 MiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
m-a-p/FineFineWeb 可在线预览 已完整同步
FineFineWeb 是一个大规模英文网页语料库,专注于细粒度领域的文本分类与生成。该数据集覆盖了航空航天、农学、艺术、计算机科学、经济学、健康、法律等数十个领域,总计超过1万亿 token。通过多次迭代处理,它提供了丰富的结构化文本,适用于文本分类、文本生成和文本到文本生成等多种自然语言处理任务。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 21 TiB 66109 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/AgentWorldBench 可在线预览 已完整同步
AgentWorldBench是一个评估语言世界模型能力的综合基准,它基于前沿模型在真实环境中执行任务时的轨迹数据构建而成。该基准覆盖了七个领域:API服务器响应、搜索引擎结果、命令行环境、代码编辑环境、Android UI、浏览器DOM以及桌面操作系统。每个评估样本包含多轮交互历史,要求模型根据之前的动作和观察,预测当前环境观察结果。评价维度包括格式、事实性、一致性、真实性和质量,旨在全面检验世界模型在推理、知识和长上下文理解方面的能力。
GITATTRIBUTESJSONLMD Apache License 2.0 245 MiB 9 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00