数据集
62 个数据集
热门分类:
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GSM8K(Grade School Math 8K)是一个包含约8500道小学数学应用题的数据集。每个问题都需要2到8步的多步推理,仅涉及基本算术运算(加减乘除),解答以自然语言形式呈现,而非纯数学表达式。该数据集旨在测试语言模型在基础数学推理方面的能力,适合用于文本生成任务。