数据集

9 个数据集
已选筛选: 文本生成 GITATTRIBUTES Apache-2.0 清除所有筛选
中文基于Qwen3-235B-2507蒸馏数据集 可在线预览 已完整同步
这个数据集包含约11万条中文对话样本,每条数据由用户提问和模型回答组成,内容涵盖广泛的知识与推理场景。数据基于高性能大语言模型生成,旨在用于微调时作为通用数据集混合,帮助模型保持知识广度、避免遗忘。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 528 MiB 4 个文件 WeHub 同步于 2026-08-20 15:13:43 +00:00
Qwen3-30B-A3B-Thinking-2507 是一个基于 Transformer 的因果语言模型,采用混合专家(MoE)架构,总参数量为 30.5B,每次推理仅激活 3.3B 参数。它原生支持高达 262K 的上下文长度,在逻辑推理、数学、科学、编程等复杂推理任务上表现显著提升,同时指令遵循、工具使用、文本生成等通用能力也有明显增强。该模型默认开启深度思考模式,特别适合处理高复杂度的推理场景。
GITATTRIBUTESJSONMDSAFETENSORSTXT Apache License 2.0 57 GiB 27 个文件 WeHub 同步于 2026-08-20 02:03:47 +00:00
Fineweb-Edu-Chinese-V2.2 已完整同步
Chinese Fineweb-Edu 数据集 V2.2 是一个面向中文教育领域的高质量数据集,覆盖从预训练到监督微调(SFT)的完整流程。该版本基于 DeepSeek V3.2 模型,从顶尖质量语料中提取了 143 万条高质量问答对,专为后训练阶段设计。数据集包含 SFT 问答、SFT 上下文和预训练等多种配置,旨在解决中文开源社区中优质教育语料稀缺的问题,助力提升模型在教育场景下的表现。
GITATTRIBUTESMDPDF Apache License 2.0 207 KiB 3 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
AI-MO/NuminaMath-CoT 可在线预览 已完整同步
NuminaMath-CoT 是数学推理训练与评测数据集,包含约 86 万道数学题及对应解答,字段包括题目、解答、来源和多轮消息,并提供训练集与测试集。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.1 GiB 8 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
thu-pacman/PCMind-2.1-Kaiyuan-2B 可在线预览 已完整同步
这个数据集是为PCMind-v2.1-Kaiyuan-2B语言模型提供的完整预训练数据集,总规模超过1TB。它包含5个训练阶段,覆盖英语、中文、代码、数学和SFT五大领域,并采用领域特定的混合策略和两种采样方式(前两阶段均匀采样,后三阶段基于课程学习排序)。数据以文本形式呈现,支持中英文,适用于文本生成任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 2.8 TiB 660 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LLaDA2.0-flash-preview 是一个基于扩散技术的语言模型,采用混合专家(MoE)架构,总参数量达1000亿,但推理时仅激活约61亿参数,显著降低了计算成本。它在代码生成、复杂数学推理以及工具调用等任务上表现突出,并在多个基准测试中展现出与同类开源模型相比更优的性能。该模型支持指令微调,适用于实际应用场景,未来还将通过强化学习进一步提升推理能力。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 52 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xai-org/grok-1 已完整同步
Grok-1 是一个基于 Apache-2.0 许可证开源的文本生成模型,拥有 3140 亿参数。该模型提供了开放权重,适用于多 GPU 环境下的推理。由于参数量巨大,运行需要配备多块 GPU 的机器。
GITATTRIBUTESMD Apache License 2.0 156 GiB 773 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/QwQ-32B 已完整同步
QwQ-32B是Qwen系列中的推理模型,拥有32.5B参数,基于Transformer架构,支持最长131,072 tokens的上下文。它经过预训练、监督微调与强化学习,具备深度思考与推理能力,在复杂任务上表现优异,可对标业界领先的推理模型。
GITATTRIBUTESJPGJSONMDSAFETENSORSTXT Apache License 2.0 57 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
GITATTRIBUTESJSONMD Apache License 2.0 236 MiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00