数据集
4 个数据集
热门分类:
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
这个数据集专为 LaTeX 光学字符识别(OCR)任务设计,包含图像到文本的配对样本。它提供了多种子集:一个约 100K 样本的印刷体完整数据集,一个同样规模的手写体合成数据集,以及一个较小但更贴近真实手写场景的数据集。此外,还有一个小规模测试集(110 条)和基于真实手写公式渲染的印刷体版本。每个子集都划分为训练、验证和测试三部分,方便模型训练与评估。
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
MMLU(大规模多任务语言理解)是一个涵盖57个学科的多选题数据集,用于评估语言模型在广泛知识领域的理解能力。数据集包含问题、四个选项和正确答案,覆盖从抽象代数、天文学到临床知识等众多领域,提供了测试集、验证集和开发集等划分。