数据集

31 个数据集
已选筛选: Apache License 2.0 清除所有筛选
czxxkj/DL3DV-ALL-960P 已完整同步
DL3DV-ALL-960P 是一个包含大量 960P 分辨率图像及其对应相机位姿的数据集,主要用于 3D 视觉领域的研究,如神经辐射场(NeRF)、3D 高斯泼溅、新视角合成以及文本/图像到 3D 的生成等任务。该数据集规模庞大,超过 1TB,覆盖了丰富的真实场景,为 3D 场景理解与重建提供了高质量的训练和评估资源。
GITATTRIBUTESMDZIP Apache License 2.0 2.7 TiB 10584 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
ZhengboZhang/train-images 已完整同步
这是一个包含训练图像的数据集,主要提供常见图片格式(如jpg、png、jpeg、webp)的文件,并附带一些元数据文件(如json、md),适用于图像处理或机器学习相关任务。
GITATTRIBUTESJPEGJPGJSONMDPNGWEBP Apache License 2.0 782 MiB 4617 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
huangjintao/latex_ocr_test 可在线预览 已完整同步
该数据集主要用于LaTeX OCR(光学字符识别)测试,包含图片(PNG格式)以及对应的标注文件(JSON、JSONL等),可用于训练或评估将LaTeX公式图像转换为可编辑文本的模型。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 313 KiB 54 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
Tongyi-DataEngine/SA1B-Dense-Caption 可在线预览 已完整同步
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 280 GiB 727 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
modelscope/gsm8k 已完整同步
GSM8K 是小学数学文字题与解答资源,当前镜像包含 JSON、脚本和说明文件,适合数学推理训练样例、模型评测和教育研究。
JSONMDPY Apache License 2.0 6.2 KiB 3 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
RoboMIND2.0-Agilex-mobile 是移动操作机器人数据分片,包含 HDF5 数据与文本说明,共 13,952 个文件、约 10.23 TB,面向移动机器人学习与操作研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 9.3 TiB 13952 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
lvjianjin/AdvertiseGen 可在线预览 已完整同步
这是一个用于广告文案生成的中文数据集,基于商品网页的标签与文案信息对应关系构建。任务属于典型的开放式文本生成:给定商品的关键词和属性列表(key-value形式),模型需要生成与输入信息保持事实一致性的广告文案。数据集包含训练集约114k条、验证集1k条、测试集3k条,每条数据由商品属性列表(content)和对应广告文案(summary)组成。
CSVJSONMD Apache License 2.0 36 MiB 5 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
tany0699/cats_and_dogs 可在线预览 已完整同步
这是一个轻量级的猫狗二分类图像数据集,共包含两个类别。训练集有275张带标注的图片,验证集有70张,整个数据集大小约10.3MB。图片按类别分别存放在 `train` 和 `val` 文件夹下,格式为 JPG,并附带类别名称文件。由于数据量小,非常适合快速模型验证、性能评估或小规模训练实验。
CSVJSONMDTXT Apache License 2.0 26 KiB 6 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
该数据集专为心理健康领域设计,包含10,000条中文高质量样本。每条数据由用户输入、推理思维链和最终输出三部分组成,适用于心理咨询、情感分析、多轮对话等任务。数据集通过先进的推理模型生成,显著增强了模型在心理学相关任务中的推理能力和生成质量。
GITATTRIBUTESJSONMD Apache License 2.0 43 MiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
tomyzcf/qwen3-finetune-test 已完整同步
这是一个专为Qwen3模型微调设计的高质量数据集,包含两个子集:FineTome-100k(10万条指令遵循数据)和OpenMathReasoning-mini(约1.9万条数学推理数据),采用对话格式,覆盖广泛的知识与推理任务,有助于提升大语言模型的推理能力与知识密集型任务表现。数据集采用Apache 2.0许可证开放使用。
ARROWGITATTRIBUTESJSONMD Apache License 2.0 468 MiB 9 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
opencompass/mmlu 可在线预览 已完整同步
MMLU(大规模多任务语言理解)是一个涵盖57个学科的多选题数据集,用于评估语言模型在广泛知识领域的理解能力。数据集包含问题、四个选项和正确答案,覆盖从抽象代数、天文学到临床知识等众多领域,提供了测试集、验证集和开发集等划分。
GITATTRIBUTESJSONMDPARQUETPYTAR Apache License 2.0 258 MiB 181 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00