数据集

166 个数据集
已选筛选: 数据集 清除所有筛选
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
GITATTRIBUTESJSONMD Apache License 2.0 605 MiB 4 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
kevin726/hy_mm_data_v0901 已完整同步
hy_mm_data_v0901 是一个大规模多格式资源包,当前镜像包含约 1,631 个文件、约 1.22 TB 数据,主要为 ZIP 压缩包及说明/元数据文件;使用前应按目录和压缩包检查具体内容与字段。
GITATTRIBUTESMDZIP Apache License 2.0 1.1 TiB 1631 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
AI-ModelScope/LaTeX_OCR 可在线预览 已完整同步
这个数据集专为 LaTeX 光学字符识别(OCR)任务设计,包含图像到文本的配对样本。它提供了多种子集:一个约 100K 样本的印刷体完整数据集,一个同样规模的手写体合成数据集,以及一个较小但更贴近真实手写场景的数据集。此外,还有一个小规模测试集(110 条)和基于真实手写公式渲染的印刷体版本。每个子集都划分为训练、验证和测试三部分,方便模型训练与评估。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 1.0 GiB 18 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
ChatGLM评估挑战赛-金融赛道数据集 可在线预览 已完整同步
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。
CSVGITATTRIBUTESJSONJSONLMDPDF Apache License 2.0 69 GiB 11598 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
RoboMIND2.0-Agilex 已完整同步
RoboMIND2.0-Agilex 是一个以 Apache License 2.0 许可协议发布的数据集,包含 hdf5、txt 等多种格式的文件,适用于机器人相关领域的研究与应用。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 12 TiB 22274 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
匠数科技大模型sft数据集 可在线预览 已完整同步
匠数科技大模型SFT数据集是一个经过精心整理和严格审核的高质量中文及英文数据集,专为大型语言模型的监督微调(SFT)任务设计。该数据集汇总了众多开源数据,经过格式统一、清洗和内容安全筛查,最终包含超过12M条样本,并按任务类型划分为50个类别,每条样本均包含指令、输入、输出、历史对话等结构化字段,方便用户直接用于训练和评估。数据集覆盖广泛的中文任务,同时英文数据也经过单独整理,兼顾了跨语言翻译等场景,为SFT研究提供了安全、统一、易用的资源。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 27 GiB 8 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
modelscope/mmlu 已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
GITATTRIBUTESJSONMDPYTAR Apache License 2.0 159 MiB 6 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
该数据集是一个用于图像描述(image captioning)任务的数据集,包含训练和验证两个子集。每条数据由图像、对应的描述文本以及图像ID组成,适合用于训练和评估图像描述模型。数据集规模在10k到1m之间,语言为英文。
JSONMDPY Apache License 2.0 7.6 KiB 3 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
中文生活垃圾分类数据集 可在线预览 已完整同步
该数据集包含超过14万张带中文标签的生活垃圾图像,覆盖可回收垃圾、厨余垃圾、有害垃圾和其他垃圾4个标准大类,细分为265个常见生活垃圾小类。其中训练集约13.3万张,验证集约1.46万张,数据总量约13GB。图像按类别存放在不同文件夹中,并附带中文类名文件,方便直接用于垃圾分类模型的训练与评估。
CSVJPGJSONMDTXT Apache License 2.0 5.2 MiB 7 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
RoboMIND2.0-Franka-Part-5 已完整同步
该数据集是 RoboMIND2.0 框架下 Franka 机器人相关数据的第五部分,采用 Apache 2.0 许可证,包含 HDF5、文本文件等多种格式,适用于机器人操作与学习研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 8.1 TiB 17202 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
RoboMIND2.0-UR5 已完整同步
RoboMIND2.0-UR5 是面向 UR5 机械臂操作任务的数据分片,包含 HDF5 数据与文本说明,共 54,592 个文件、约 15.58 TB,适合运动规划、模仿学习和仿真研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 14 TiB 54592 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
liucong/Chinese-DeepSeek-R1-Distill-data-110k 可在线预览 已完整同步
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 645 MiB 4 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
PaddleOCR-VL_demo 是 OCR 与视觉语言模型演示资源,包含图像文件及配套说明,用于展示文档文字识别和视觉理解流程。
GITATTRIBUTESJPGMDPNG Apache License 2.0 12 MiB 23 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
qiaojiedongfeng/qiaojiedongfeng 可在线预览 已完整同步
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 56 MiB 4 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
这是RoboMIND2.0数据集中的Franka机器人部分第四部分,包含HDF5、文本等多种格式的文件,适用于机器人学习相关任务。该数据集采用Apache License 2.0许可协议。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 7.9 TiB 16125 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
tany0699/fruits100 可在线预览 已完整同步
这个数据集包含了100种不同水果的图像,可用于图像分类任务的训练、验证和性能评估。数据集分为训练集和验证集,图片按类别存放在对应的文件夹中,格式为JPG。同时提供类名文件,方便标注对应关系。
CSVJSONMDTXT Apache License 2.0 1.2 MiB 7 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
funasr-demo 已完整同步
funasr-demo 是语音识别演示/测试资源,包含 WAV 音频、SCP/TXT/JSON 标注和说明文件,共 37 个文件、约 5.1 MB,适合 ASR 流程验证。
GITATTRIBUTESJSONMDSCPTXTWAV Apache License 2.0 4.9 MiB 37 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
MSAgent-Bench-中文Agent数据集 可在线预览 已完整同步
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 2.1 GiB 6 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
MNN LLM APP 配置 已完整同步
MNN LLM APP 配置是 MNN 大模型应用配置资源,包含 JSON 配置、Markdown 说明和 Git 属性文件,共 3 个文件、约 4.5 KB,适合配置检查而非训练语料。
GITATTRIBUTESJSONMD Apache License 2.0 4.4 KiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
CMMLU 是中文大规模多任务语言理解评测集,覆盖多个知识学科和任务类别,通过中文多项选择题评估模型的知识与理解能力。
MDPYZIP Apache License 2.0 1.0 MiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00