数据集

21 个数据集
已选筛选: GITATTRIBUTES Apache License 2.0 数据集 清除所有筛选
EleutherAI/the_pile_deduplicated 可在线预览 已完整同步
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 420 GiB 1653 个文件 WeHub 同步于 2026-08-20 09:35:53 +00:00
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
GITATTRIBUTESJSONMD Apache License 2.0 605 MiB 4 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
kevin726/hy_mm_data_v0901 已完整同步
hy_mm_data_v0901 是一个大规模多格式资源包,当前镜像包含约 1,631 个文件、约 1.22 TB 数据,主要为 ZIP 压缩包及说明/元数据文件;使用前应按目录和压缩包检查具体内容与字段。
GITATTRIBUTESMDZIP Apache License 2.0 1.1 TiB 1631 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
AI-ModelScope/LaTeX_OCR 可在线预览 已完整同步
这个数据集专为 LaTeX 光学字符识别(OCR)任务设计,包含图像到文本的配对样本。它提供了多种子集:一个约 100K 样本的印刷体完整数据集,一个同样规模的手写体合成数据集,以及一个较小但更贴近真实手写场景的数据集。此外,还有一个小规模测试集(110 条)和基于真实手写公式渲染的印刷体版本。每个子集都划分为训练、验证和测试三部分,方便模型训练与评估。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 1.0 GiB 18 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
modelscope/mmlu 已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
GITATTRIBUTESJSONMDPYTAR Apache License 2.0 159 MiB 6 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
liucong/Chinese-DeepSeek-R1-Distill-data-110k 可在线预览 已完整同步
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 645 MiB 4 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
PaddleOCR-VL_demo 是 OCR 与视觉语言模型演示资源,包含图像文件及配套说明,用于展示文档文字识别和视觉理解流程。
GITATTRIBUTESJPGMDPNG Apache License 2.0 12 MiB 23 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
qiaojiedongfeng/qiaojiedongfeng 可在线预览 已完整同步
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 56 MiB 4 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
这是RoboMIND2.0数据集中的Franka机器人部分第四部分,包含HDF5、文本等多种格式的文件,适用于机器人学习相关任务。该数据集采用Apache License 2.0许可协议。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 7.9 TiB 16125 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
funasr-demo 已完整同步
funasr-demo 是语音识别演示/测试资源,包含 WAV 音频、SCP/TXT/JSON 标注和说明文件,共 37 个文件、约 5.1 MB,适合 ASR 流程验证。
GITATTRIBUTESJSONMDSCPTXTWAV Apache License 2.0 4.9 MiB 37 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
YIRONGCHEN/SoulChatCorpus 已完整同步
这是一个中文多轮共情对话数据集,包含约25.8万条对话,共计151万轮交互。对话围绕心理支持、情感倾听与安慰等主题展开,采用多轮对话格式,每条数据包含用户和助手的多轮交流。该数据集旨在提升语言模型的共情、倾听与安慰能力,适用于情感对话相关的研究与训练。
GITATTRIBUTESJSONMD Apache License 2.0 865 MiB 4 个文件 WeHub 同步于 2026-08-20 03:30:10 +00:00
baicai003/Llama3-Chinese-dataset 可在线预览 已完整同步
这是一个为训练Llama3中文模型而整合的多源指令微调数据集。它融合了英文通用指令、中文知乎问答、ShareGPT对话、中文常识任务、成语、诗词、逻辑推理、小红书风格文本等多种数据,并统一处理为firefly格式,便于直接训练。数据集包含约169万条清洗后的问答对,支持按需选择子集或合并使用,适合用于提升模型的中文理解和生成能力。
GITATTRIBUTESJSONLMDPY Apache License 2.0 4.0 GiB 23 个文件 WeHub 同步于 2026-08-20 02:08:19 +00:00
A1233213sswss/rvcmax 已完整同步
A1233213sswss/rvcmax 是 RVC 音色/语音模型资源包,按编号目录提供 WebP 预览图、Yuan 模型文件和 config.json,当前镜像约 1,389 个文件、25.7 GB。
DBGITATTRIBUTESJSONMDWEBPYUAN Apache License 2.0 24 GiB 1389 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
czxxkj/DL3DV-ALL-960P 已完整同步
DL3DV-ALL-960P 是一个包含大量 960P 分辨率图像及其对应相机位姿的数据集,主要用于 3D 视觉领域的研究,如神经辐射场(NeRF)、3D 高斯泼溅、新视角合成以及文本/图像到 3D 的生成等任务。该数据集规模庞大,超过 1TB,覆盖了丰富的真实场景,为 3D 场景理解与重建提供了高质量的训练和评估资源。
GITATTRIBUTESMDZIP Apache License 2.0 2.7 TiB 10584 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
ZhengboZhang/train-images 已完整同步
这是一个包含训练图像的数据集,主要提供常见图片格式(如jpg、png、jpeg、webp)的文件,并附带一些元数据文件(如json、md),适用于图像处理或机器学习相关任务。
GITATTRIBUTESJPEGJPGJSONMDPNGWEBP Apache License 2.0 782 MiB 4617 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
huangjintao/latex_ocr_test 可在线预览 已完整同步
该数据集主要用于LaTeX OCR(光学字符识别)测试,包含图片(PNG格式)以及对应的标注文件(JSON、JSONL等),可用于训练或评估将LaTeX公式图像转换为可编辑文本的模型。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 313 KiB 54 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
Tongyi-DataEngine/SA1B-Dense-Caption 可在线预览 已完整同步
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 280 GiB 727 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
RoboMIND2.0-Agilex-mobile 是移动操作机器人数据分片,包含 HDF5 数据与文本说明,共 13,952 个文件、约 10.23 TB,面向移动机器人学习与操作研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 9.3 TiB 13952 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
该数据集专为心理健康领域设计,包含10,000条中文高质量样本。每条数据由用户输入、推理思维链和最终输出三部分组成,适用于心理咨询、情感分析、多轮对话等任务。数据集通过先进的推理模型生成,显著增强了模型在心理学相关任务中的推理能力和生成质量。
GITATTRIBUTESJSONMD Apache License 2.0 43 MiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
tomyzcf/qwen3-finetune-test 已完整同步
这是一个专为Qwen3模型微调设计的高质量数据集,包含两个子集:FineTome-100k(10万条指令遵循数据)和OpenMathReasoning-mini(约1.9万条数学推理数据),采用对话格式,覆盖广泛的知识与推理任务,有助于提升大语言模型的推理能力与知识密集型任务表现。数据集采用Apache 2.0许可证开放使用。
ARROWGITATTRIBUTESJSONMD Apache License 2.0 468 MiB 9 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00