AI-ModelScope/LaTeX_OCR 已完整同步
LaTeX OCR 的数据仓库
本数据仓库是专为 LaTeX_OCR 及 LaTeX_OCR_PRO 制作的数据,来源于 https://zenodo.org/record/56198#.V2p0KTXT6eA 以及 https://www.isical.ac.in/~crohme/ 以及我们自己构建。
如果这个数据仓库有帮助到你的话,请点亮 ❤️like ++
后续追加新的数据也会放在这个仓库 ~~
原始数据仓库在github LinXueyuanStdio/Data-for-LaTeX_OCR.
数据集
本仓库有 5 个数据集
small是小数据集,样本数 110 条,用于测试full是印刷体约 100k 的完整数据集。实际上样本数略小于 100k,因为用 LaTeX 的抽象语法树剔除了很多不能渲染的 LaTeX。synthetic_handwrite是手写体 100k 的完整数据集,基于full的公式,使用手写字体合成而来,可以视为人类在纸上的手写体。样本数实际上略小于 100k,理由同上。human_handwrite是手写体较小数据集,更符合人类在电子屏上的手写体。主要来源于CROHME。我们用 LaTeX 的抽象语法树校验过了。human_handwrite_print是来自human_handwrite的印刷体数据集,公式部分和human_handwrite相同,图片部分由公式用 LaTeX 渲染而来。
使用
加载训练集
- name 可选 small, full, synthetic_handwrite, human_handwrite, human_handwrite_print
- split 可选 train, validation, test
>>> from modelscope import MsDataset
>>> train_dataset = MsDataset.load("AI-ModelScope/LaTeX_OCR", subset_name="small", split="train")
>>> train_dataset[2]
{'image': <PIL.PngImagePlugin.PngImageFile image mode=RGB size=200x50 at 0x15A5D6CE210>,
'text': '\\rho _ { L } ( q ) = \\sum _ { m = 1 } ^ { L } \\ P _ { L } ( m ) \\ { \\frac { 1 } { q ^ { m - 1 } } } .'}
>>> len(train_dataset)
50
# 备注: default subset为full,加载full时直接使用:
>>> ds = MsDataset.load("AI-ModelScope/LaTeX_OCR", split="train")
加载所有
>>> from modelscope import MsDataset
>>> dataset = MsDataset.load('AI-ModelScope/LaTeX_OCR', subset_name='small')
>>> dataset
DatasetDict({
train: Dataset({
features: ['image', 'text'],
num_rows: 50
})
validation: Dataset({
features: ['image', 'text'],
num_rows: 30
})
test: Dataset({
features: ['image', 'text'],
num_rows: 30
})
})
18 个文件
浏览文件数据集版权信息
本数据集的许可证为 Apache License 2.0。如有违反相关条款,请联系 WEHUB,我们将及时处理。
下载数据集
通过 WeHub CLI 下载当前数据集快照。下列命令会固定为当前页面展示的数据版本(如果页面提供版本)。文件字节由本机直连存储下载,浏览器不会签发或保存下载链接。
前置要求
需要 Node.js 18 及以上,以及 npm(或 npx)。
1. 安装 CLI
npm install -g wehub-cli@latest
2. 下载此数据集
wehub datasets download ds_ext_dafc972729 --revision c611854d97d5a4218847e26111dfca0a69c3748d --output ./ds_ext_dafc972729
若中断或部分失败,在同一目录重新执行同一命令即可续传。默认会校验 SHA-256。
免全局安装
npx --yes wehub-cli@latest datasets download ds_ext_dafc972729 --revision c611854d97d5a4218847e26111dfca0a69c3748d --output ./ds_ext_dafc972729
高级选项
以下为 wehub datasets download 已支持的参数示例:
强制重新下载,不复用已校验的本地文件
wehub datasets download ds_ext_dafc972729 --revision c611854d97d5a4218847e26111dfca0a69c3748d --output ./ds_ext_dafc972729 --overwrite
仅包含匹配路径
wehub datasets download ds_ext_dafc972729 --revision c611854d97d5a4218847e26111dfca0a69c3748d --output ./ds_ext_dafc972729 --include "*.jsonl"
排除匹配路径
wehub datasets download ds_ext_dafc972729 --revision c611854d97d5a4218847e26111dfca0a69c3748d --output ./ds_ext_dafc972729 --exclude "*.md"
提高并发下载数
wehub datasets download ds_ext_dafc972729 --revision c611854d97d5a4218847e26111dfca0a69c3748d --output ./ds_ext_dafc972729 --jobs 8
完整帮助:wehub datasets download --help