此网站需要 JavaScript。
我的项目
项目探索
数据集
注册
登录
数据集
1 个数据集
类型
全部
全部
数据集
模型
格式
ZIP
全部
MD
223
GITATTRIBUTES
206
JSON
168
JSONL
69
SAFETENSORS
64
PARQUET
62
TXT
57
PNG
53
MP4
42
PY
39
CSV
21
JPG
17
BIN
15
PT
15
YAML
14
JINJA
13
MODEL
12
PDF
12
HDF5
9
ONNX
9
WAV
9
ZIP
9
GZ
8
JPEG
7
WEBP
6
MVN
5
PTH
5
GITIGNORE
4
IPYNB
4
TAR
4
XML
4
HTML
3
MP3
3
MSGPACK
3
SVG
3
XLSX
3
DOCX
2
GIF
2
H5
2
JS
2
PPTX
2
SH
2
SRT
2
TEX
2
WHL
2
XLS
2
0
1
1
1
2
1
3
1
4
1
5
1
6
1
APK
1
ARROW
1
BIB
1
BINARY
1
BMP
1
CKPT
1
CSS
1
DAT
1
DATA
1
DB
1
DEEPSEEK
1
DISTCP
1
DMG
1
DOC
1
EML
1
EPUB
1
EXE
1
FILE
1
FST
1
GGUF
1
KEEP
1
LOCK
1
METADATA
1
MLMODEL
1
MSC
1
MV
1
NPY
1
NPZ
1
ODS
1
ODT
1
OT
1
PBF
1
PCK
1
PKG
1
PKL
1
PPT
1
RAW
1
RS
1
SCP
1
SQLITE
1
TOML
1
VSIX
1
WASM
1
XCF
1
XZ
1
YUAN
1
ZST
1
许可
全部
全部
apache-2.0
110
mit
49
Apache-2.0
32
Apache License 2.0
31
cc0-1.0
5
cc-by-4.0
4
odbl
2
MIT
1
仅看可在线预览
排序
最近同步
最近同步
按大小
名称
热门分类:
自然语言处理
12
计算机视觉
1
语音识别
4
基准测试
2
数学
1
机器人操作
34
gitattributes
19
家庭场景
16
文本生成
16
md
12
抓取与放置
12
模仿学习
11
大语言模型
9
数学推理
9
代码生成
8
厨房场景
7
mp4
6
强化学习
6
问答
6
HDF5数据
5
py
5
多模态理解
5
文本转语音
5
机器人学习
5
已选筛选:
自然语言处理
ZIP
清除所有筛选
liwu/MNBVC
可在线预览
已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTES
GZ
MD
PARQUET
PY
TXT
ZIP
MIT License
3.3 TiB
24126 个文件
WeHub 同步于
2026-08-05 08:09:00 +00:00