数据集 / 中文Text2SQL数据集

中文Text2SQL数据集 已完整同步

中文Text2SQL训练数据

数据集描述

同时包含用于训练和测试表格问答预训练模型的数据,数据集包含500条训练数据和100条测试数据。

数据集简介

表格问答预训练模型的训练和测试数据,支持中文,支持通用领域的表格问答。

数据集下载

安装最新的modelscope库之后,运行如下代码,即可获得数据集。

import json
from modelscope.msdatasets import MsDataset
from modelscope.utils.constant import DownloadMode

# load data
input_dataset = MsDataset.load(
    'ChineseText2SQL', download_mode=DownloadMode.FORCE_REDOWNLOAD)
train_dataset = []
for name in input_dataset['train']._hf_ds.data[1]:
    train_dataset.append(json.load(open(str(name), 'r')))
eval_dataset = []
for name in input_dataset['test']._hf_ds.data[1]:
    eval_dataset.append(json.load(open(str(name), 'r')))
print('size of training set', len(train_dataset))
print('size of evaluation set', len(eval_dataset))

另外,也可以从本model card中,点击数据集文件panel,然后点击数据文件选项,即可下载trian.zip和test.zip文件。

6 个文件

浏览文件