数据集
7 个数据集
热门分类:
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
modelscope/mmlu
已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
这是一个高质量的中文预训练语料数据集,专门面向教育领域,包含约9000万条经过严格筛选的文本,总数据量约300GB。该数据集采用类似Fineweb-Edu的构建方法:先利用评分模型评估样本的教育价值,再训练BERT模型对原始数据进行打分,仅保留评分高于4的数据,最后通过MinHash算法进行去重,确保内容质量高、多样性强且无冗余。它适用于中文自然语言处理中的文本生成等任务,尤其适合教育场景下的模型训练和微调。
Fineweb-Edu-Chinese-V2.2
已完整同步
Chinese Fineweb-Edu 数据集 V2.2 是一个面向中文教育领域的高质量数据集,覆盖从预训练到监督微调(SFT)的完整流程。该版本基于 DeepSeek V3.2 模型,从顶尖质量语料中提取了 143 万条高质量问答对,专为后训练阶段设计。数据集包含 SFT 问答、SFT 上下文和预训练等多种配置,旨在解决中文开源社区中优质教育语料稀缺的问题,助力提升模型在教育场景下的表现。
wormtooth/MNBVC-judgment
已完整同步
MNBVC-judgment 是中文裁判文书语料,采用 MNBVC 通用数据格式并以压缩文件提供,适合用于法律文本处理与中文语言模型研究。
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。