数据集

242 个数据集
RoboMIND2.0-UR5 已完整同步
RoboMIND2.0-UR5 是面向 UR5 机械臂操作任务的数据分片,包含 HDF5 数据与文本说明,共 54,592 个文件、约 15.58 TB,适合运动规划、模仿学习和仿真研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 14 TiB 54592 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
liucong/Chinese-DeepSeek-R1-Distill-data-110k 可在线预览 已完整同步
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 645 MiB 4 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
PaddleOCR-VL_demo 是 OCR 与视觉语言模型演示资源,包含图像文件及配套说明,用于展示文档文字识别和视觉理解流程。
GITATTRIBUTESJPGMDPNG Apache License 2.0 12 MiB 23 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
qiaojiedongfeng/qiaojiedongfeng 可在线预览 已完整同步
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 56 MiB 4 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
这是RoboMIND2.0数据集中的Franka机器人部分第四部分,包含HDF5、文本等多种格式的文件,适用于机器人学习相关任务。该数据集采用Apache License 2.0许可协议。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 7.9 TiB 16125 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
tany0699/fruits100 可在线预览 已完整同步
这个数据集包含了100种不同水果的图像,可用于图像分类任务的训练、验证和性能评估。数据集分为训练集和验证集,图片按类别存放在对应的文件夹中,格式为JPG。同时提供类名文件,方便标注对应关系。
CSVJSONMDTXT Apache License 2.0 1.2 MiB 7 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
funasr-demo 已完整同步
funasr-demo 是语音识别演示/测试资源,包含 WAV 音频、SCP/TXT/JSON 标注和说明文件,共 37 个文件、约 5.1 MB,适合 ASR 流程验证。
GITATTRIBUTESJSONMDSCPTXTWAV Apache License 2.0 4.9 MiB 37 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
MSAgent-Bench-中文Agent数据集 可在线预览 已完整同步
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 2.1 GiB 6 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 868 MiB 11 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
MNN LLM APP 配置 已完整同步
MNN LLM APP 配置是 MNN 大模型应用配置资源,包含 JSON 配置、Markdown 说明和 Git 属性文件,共 3 个文件、约 4.5 KB,适合配置检查而非训练语料。
GITATTRIBUTESJSONMD Apache License 2.0 4.4 KiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
CMMLU 是中文大规模多任务语言理解评测集,覆盖多个知识学科和任务类别,通过中文多项选择题评估模型的知识与理解能力。
MDPYZIP Apache License 2.0 1.0 MiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
RoboMIND2.0-Franka-Part-2 已完整同步
RoboMIND2.0-Franka-Part-2 是 Franka 机械臂操作数据分片,包含 HDF5 二进制数据与文本说明,共 22,047 个文件、约 9.81 TB,适合操作技能学习与行为仿真。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 8.9 TiB 22047 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
该数据集包含多轮心理咨询对话,用于构建心理咨询师的数字孪生模型。数据基于少量真实咨询案例,通过大语言模型生成,保留了特定咨询师的语言风格与疗法技术,涵盖单轮与多轮对话。训练集约4760个对话,测试集约240个对话,总计超9万轮次,适合用于微调模型以模拟具有个性化咨询风格的心理健康助理。
GITATTRIBUTESJSONMD Apache License 2.0 76 MiB 5 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
m-a-p/Matrix 可在线预览 已完整同步
Matrix 是面向大语言模型预训练的中英文大规模语料资源,包含多个来源和处理阶段,规模约为数万亿 token。
GITATTRIBUTESJSONLMD Apache License 2.0 18 TiB 496 个文件 WeHub 同步于 2026-08-20 03:33:46 +00:00
builddotai/Egocentric-10K 已完整同步
Egocentric-10K 是目前规模最大的以自我为中心视角的数据集,也是首个完全在真实工厂环境中采集的数据。它包含超过 10,000 小时、约 10.8 亿帧的视频素材,共 192,900 个视频片段,中位时长为 180 秒。视频采用 H.265 编码的 1080p 分辨率,帧率 30 fps,由单目头戴摄像机拍摄,视野为 128° 水平、67° 垂直。数据以 WebDataset 格式存储,每个 tar 包中视频与 JSON 元数据成对出现,并提供基于 OpenCV 鱼眼模型的相机内参。该数据集覆盖 85 个工厂中的多名工人,在手部可见性和主动操作密集度方面达到了当前最优水平。
GITATTRIBUTESJSONMDPNGTAR Apache License 2.0 16 TiB 21645 个文件 WeHub 同步于 2026-08-20 03:33:46 +00:00
YIRONGCHEN/SoulChatCorpus 已完整同步
这是一个中文多轮共情对话数据集,包含约25.8万条对话,共计151万轮交互。对话围绕心理支持、情感倾听与安慰等主题展开,采用多轮对话格式,每条数据包含用户和助手的多轮交流。该数据集旨在提升语言模型的共情、倾听与安慰能力,适用于情感对话相关的研究与训练。
GITATTRIBUTESJSONMD Apache License 2.0 865 MiB 4 个文件 WeHub 同步于 2026-08-20 03:30:10 +00:00
lcl193798/product_description_generation 可在线预览 已完整同步
该数据集面向商品文案描述生成任务,属于data-to-text类型,可用于训练模型将商品卖点关键词转化为完整的文案描述。包含3848条测试样本,每条样本由输入的商品卖点词(text1)和输出的文案描述(text2)组成,适合用于生成式文本建模。
CSVJSONMD Apache License 2.0 1.3 MiB 4 个文件 WeHub 同步于 2026-08-20 02:28:19 +00:00
RoboMIND2.0-Ark 已完整同步
RoboMIND2.0-Ark 是机器人操作数据分片,包含 HDF5 数据与文本说明,共 14,913 个文件、约 10.45 TB,适合机器人运动规划、仿真和感知研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 9.5 TiB 14913 个文件 WeHub 同步于 2026-08-20 02:22:16 +00:00
baicai003/Llama3-Chinese-dataset 可在线预览 已完整同步
这是一个为训练Llama3中文模型而整合的多源指令微调数据集。它融合了英文通用指令、中文知乎问答、ShareGPT对话、中文常识任务、成语、诗词、逻辑推理、小红书风格文本等多种数据,并统一处理为firefly格式,便于直接训练。数据集包含约169万条清洗后的问答对,支持按需选择子集或合并使用,适合用于提升模型的中文理解和生成能力。
GITATTRIBUTESJSONLMDPY Apache License 2.0 4.0 GiB 23 个文件 WeHub 同步于 2026-08-20 02:08:19 +00:00
FSMN语音端点检测(VAD)模型专为中文通用场景设计,支持16kHz采样率的音频输入。该模型基于FSMN架构,已导出为ONNX量化格式,便于在生产环境中直接部署,实现高效的语音活性检测。它能够准确判断音频中语音段的起止位置,适用于实时或离线语音识别等任务。
GITATTRIBUTESJSONMDMVNONNXYAML Apache License 2.0 511 KiB 7 个文件 WeHub 同步于 2026-08-20 02:05:54 +00:00