数据集
1 个数据集
热门分类:
Fineweb-Edu-Chinese-V2.1
已完整同步
Fineweb-Edu-Chinese-V2.1 是一个面向中文教育领域的大规模文本生成数据集。它包含按质量评分分档整理的内容,评分范围从 2 到 5,其中 4-5 分为高质量教育文本(约 70GB,460 亿 token),3-4 分为较适用的内容(约 800GB,5300 亿 token),2-3 分则为潜在可用但质量有限的数据(约 1.4TB,9300 亿 token)。数据集以文件夹形式组织,便于用户根据训练时间和计算资源灵活选择不同质量档位的数据,适用于各类语言模型的训练与微调。