数据集

3 个数据集
已选筛选: gitattributes PARQUET apache-2.0 清除所有筛选
IndustryCorpus2 是一个覆盖 30 余个行业类别的高质量预训练数据集,包含中文约 1TB、英文约 2.2TB 的文本数据。数据经过规则与模型双重语义质量筛选,并根据质量评估分数划分为高、中、低三个层级,以适配不同场景的模型训练需求。行业分类结合了国民经济行业分类与世界知识体系,涵盖编程、生物医药、法律、金融、数学统计、交通运输、航空航天、制造业等主流领域,旨在为行业大模型提供专业、大规模且高质量的训练语料。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.7 TiB 3206 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
williamium/CoreCognition 可在线预览 已完整同步
CoreCognition 是一个面向多模态大语言模型的核心知识基准数据集,源于发展认知科学中的12项基本能力。它包含1,423个多模态样本和80个概念挑战问题,涉及对象持久性、空间推理、计数等人类直觉中固有的核心能力,旨在评估模型在基础认知任务上的表现。
GITATTRIBUTESJPGMDPARQUETZIP Apache License 2.0 8.1 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenAssistant/oasst1 可在线预览 已完整同步
这是一个大规模、多语言的对话数据集,由13,500多名志愿者众包构建而成。其中包含超过16万条人类编写的助手式对话消息,覆盖35种语言,并附有超过46万条质量评分。数据以对话树形式组织,每条消息包含角色(助手或提示者)、语言、审核结果、标签以及毒性评估等丰富字段,可用于训练和评估对话模型的对齐能力。
GITATTRIBUTESGZMDPARQUET Apache License 2.0 221 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00