数据集

4 个数据集
已选筛选: 问答 MD Apache-2.0 清除所有筛选
中文基于Qwen3-235B-2507蒸馏数据集 可在线预览 已完整同步
这个数据集包含约11万条中文对话样本,每条数据由用户提问和模型回答组成,内容涵盖广泛的知识与推理场景。数据基于高性能大语言模型生成,旨在用于微调时作为通用数据集混合,帮助模型保持知识广度、避免遗忘。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 528 MiB 4 个文件 WeHub 同步于 2026-08-20 15:13:43 +00:00
Fineweb-Edu-Chinese-V2.2 已完整同步
Chinese Fineweb-Edu 数据集 V2.2 是一个面向中文教育领域的高质量数据集,覆盖从预训练到监督微调(SFT)的完整流程。该版本基于 DeepSeek V3.2 模型,从顶尖质量语料中提取了 143 万条高质量问答对,专为后训练阶段设计。数据集包含 SFT 问答、SFT 上下文和预训练等多种配置,旨在解决中文开源社区中优质教育语料稀缺的问题,助力提升模型在教育场景下的表现。
GITATTRIBUTESMDPDF Apache License 2.0 207 KiB 3 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
cloudcatcher2/VCBench 已完整同步
VCBench 是一个标准化的视觉语言模型评估框架,专注于数学领域的问答任务。该数据集提供了标准评估和 GPT 辅助评估两种方式,帮助用户衡量模型在单选题和自然语言回答上的表现。评估脚本会输出整体准确率以及按问题类型细分的准确率,方便用户深入分析模型能力。
GITATTRIBUTESJSONMDPNG Apache License 2.0 99 MiB 8423 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
GITATTRIBUTESJSONMD Apache License 2.0 236 MiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00