数据集

3 个数据集
已选筛选: 自然语言处理 GITATTRIBUTES Apache License 2.0 清除所有筛选
EleutherAI/the_pile_deduplicated 可在线预览 已完整同步
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 420 GiB 1653 个文件 WeHub 同步于 2026-08-20 09:35:53 +00:00
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
GITATTRIBUTESJSONMD Apache License 2.0 605 MiB 4 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
modelscope/mmlu 已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
GITATTRIBUTESJSONMDPYTAR Apache License 2.0 159 MiB 6 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00