数据集 / liwu/MNBVC

liwu/MNBVC 已完整同步

Dataset Card for MNBVC

Table of Contents

  • Dataset Card for MNBVC
    • Table of Contents
    • Dataset Description
      • 数据集介绍
    • 数据子集
    • 数据格式
      • 文本数据
      • 问答数据
      • Contributions

Dataset Description

数据集介绍

中文互联网上最古老最神秘(没有之一)的MOP里屋社区于2023.1.1庄重宣布:

在英明神武的猫扑管子带领下,决心发挥社区所长(哪都长),帮助开源社区长期更新一份最大的中文互联网语料集。

Huggingface上的MNBVC数据集在逐渐更新中,请到https://github.com/esbatmop/MNBVC 获取未完成清洗的更多数据。

可以使用如下脚本加载:

from datasets import load_dataset
# 对应语料数据加载
# 请参考: 下面表格中的标签字段字段内容
# 如:序号1,arXiv文献的文本。,标签字典:academic_paper 
dataset_arxiv = load_dataset("liwu/MNBVC", 'academic_paper', split='train', streaming=True)
# 如:序号38,法律判决书文本,标签字典:law_judgement  
dataset_law_judgement = load_dataset("liwu/MNBVC", 'law_judgement', split='train', streaming=True)

next(iter(dataset))  # get the first line

数据子集

MNBVC数据集包含数个子集:

序号 一级目录 二级目录 描述说明 标签字典 备注
1 academic_paper - 来自文献的文本。 - -
1.1 academic_paper arxiv 来自arXiv文献的文本。 academic_paper -
2 blog - 博客语料目录 blog -
2.1 blog 163_blog - blog -
2.2 blog ai_blog - blog -
2.3 blog it_blog - blog -
3 book - 书籍语料目录 book -
3.1 book InfoSec - book -
4 co_ann_report - 企业年报文本。 co_ann_report -
4.1 code - 来自代码的文本

24126 个文件

浏览文件