数据集

4 个数据集
已选筛选: 自然语言处理 JSON 数据集 清除所有筛选
EleutherAI/the_pile_deduplicated 可在线预览 已完整同步
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 420 GiB 1653 个文件 WeHub 同步于 2026-08-20 09:35:53 +00:00
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
GITATTRIBUTESJSONMD Apache License 2.0 605 MiB 4 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
modelscope/mmlu 已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
GITATTRIBUTESJSONMDPYTAR Apache License 2.0 159 MiB 6 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
中文Text2SQL数据集 可在线预览 已完整同步
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
CSVJSONMDPNG Apache License 2.0 1.3 MiB 6 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00