数据集

223 个数据集
已选筛选: MD 清除所有筛选
RoboMIND2.0-Franka-Part-1 已完整同步
RoboMIND2.0-Franka-Part-1 是 Franka 机械臂操作数据分片,包含 HDF5 数据与文本说明,共 18,684 个文件、约 9.57 TB,适合机器人行为学习与控制研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 8.7 TiB 18684 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
RoboMIND2.0-Franka-Part-3 已完整同步
RoboMIND2.0-Franka-Part-3 是一个面向机器人操作任务的数据集,以 HDF5 和文本格式存储数据文件,包含二进制与文本内容,采用 Apache License 2.0 许可。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 13 TiB 38790 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
IndustryCorpus2 是一个覆盖 30 余个行业类别的高质量预训练数据集,包含中文约 1TB、英文约 2.2TB 的文本数据。数据经过规则与模型双重语义质量筛选,并根据质量评估分数划分为高、中、低三个层级,以适配不同场景的模型训练需求。行业分类结合了国民经济行业分类与世界知识体系,涵盖编程、生物医药、法律、金融、数学统计、交通运输、航空航天、制造业等主流领域,旨在为行业大模型提供专业、大规模且高质量的训练语料。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.7 TiB 3206 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
zai-org/GLM-4.7 已完整同步
GLM-4.7是一个专注于编码和复杂推理的语言模型,支持英文和中文。相比前代,它在多语言代理编码、终端任务、工具使用和复杂推理方面均有显著提升,同时优化了UI生成质量,能够生成更精美、布局更准确的网页和幻灯片。
GITATTRIBUTESJINJAJSONMDSAFETENSORSYAML MIT License 668 GiB 104 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
Tongyi-DataEngine/SA1B-Dense-Caption 可在线预览 已完整同步
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 280 GiB 727 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
这是一个中文句子嵌入模型,基于CoSENT方法训练,能够将句子映射为768维的稠密向量,适用于语义相似度计算、文本匹配和语义搜索等任务。模型在多个中文语义评测数据集上取得了较好的表现。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
modelscope/gsm8k 已完整同步
GSM8K 是小学数学文字题与解答资源,当前镜像包含 JSON、脚本和说明文件,适合数学推理训练样例、模型评测和教育研究。
JSONMDPY Apache License 2.0 6.2 KiB 3 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
RoboMIND2.0-Agilex-mobile 是移动操作机器人数据分片,包含 HDF5 数据与文本说明,共 13,952 个文件、约 10.23 TB,面向移动机器人学习与操作研究。
GITATTRIBUTESHDF5MDTXT Apache License 2.0 9.3 TiB 13952 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
这是一个高质量的中文预训练语料数据集,专门面向教育领域,包含约9000万条经过严格筛选的文本,总数据量约300GB。该数据集采用类似Fineweb-Edu的构建方法:先利用评分模型评估样本的教育价值,再训练BERT模型对原始数据进行打分,仅保留评分高于4的数据,最后通过MinHash算法进行去重,确保内容质量高、多样性强且无冗余。它适用于中文自然语言处理中的文本生成等任务,尤其适合教育场景下的模型训练和微调。
GITATTRIBUTESMDPARQUETPDFPNGWEBP Apache License 2.0 290 GiB 310 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
中文诗词数据集 可在线预览 已完整同步
这是一个中文诗词数据集,收录了从中国古代各朝代的诗词作品,可用于训练诗词续写模型。数据集包含约38.9万条训练样本和1710条测试样本,每条记录以“text1”字段存储一段完整的诗词内容。数据格式支持CSV、JSON和Markdown,便于不同场景下的使用。
CSVJSONMD Apache License 2.0 42 MiB 5 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
中文Text2SQL数据集 可在线预览 已完整同步
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
CSVJSONMDPNG Apache License 2.0 1.3 MiB 6 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
Qwen/Qwen3.5-4B 已完整同步
Qwen3.5-4B 是一个拥有 40 亿参数的多模态大语言模型,能够同时处理图像和文本输入。它采用高效的混合架构,结合了 Gated Delta Networks 与稀疏混合专家,在保持低延迟的同时实现高吞吐推理。该模型原生支持 26 万 token 的上下文长度,并可扩展至百万级,还覆盖了 201 种语言,具备广泛的语言和文化理解能力。通过大规模强化学习训练,它在推理、代码、代理任务和视觉理解等方面表现出色。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 8.7 GiB 14 个文件 WeHub 同步于 2026-08-19 14:32:57 +00:00
lvjianjin/AdvertiseGen 可在线预览 已完整同步
这是一个用于广告文案生成的中文数据集,基于商品网页的标签与文案信息对应关系构建。任务属于典型的开放式文本生成:给定商品的关键词和属性列表(key-value形式),模型需要生成与输入信息保持事实一致性的广告文案。数据集包含训练集约114k条、验证集1k条、测试集3k条,每条数据由商品属性列表(content)和对应广告文案(summary)组成。
CSVJSONMD Apache License 2.0 36 MiB 5 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
这是一个中文数据集,包含约11万条从DeepSeek-R1蒸馏得到的指令-回答对,已整合为可直接用于监督微调(SFT)的格式。数据涵盖数学、考试、STEM及通用领域(如逻辑推理、小红书、知乎等),并保留了模型打分结果(如正确性、无害性、有用性),便于后续筛选。请注意,数据由模型生成,未经严格验证,使用时需自行甄别。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 647 MiB 4 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
tany0699/cats_and_dogs 可在线预览 已完整同步
这是一个轻量级的猫狗二分类图像数据集,共包含两个类别。训练集有275张带标注的图片,验证集有70张,整个数据集大小约10.3MB。图片按类别分别存放在 `train` 和 `val` 文件夹下,格式为 JPG,并附带类别名称文件。由于数据量小,非常适合快速模型验证、性能评估或小规模训练实验。
CSVJSONMDTXT Apache License 2.0 26 KiB 6 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
该数据集专为心理健康领域设计,包含10,000条中文高质量样本。每条数据由用户输入、推理思维链和最终输出三部分组成,适用于心理咨询、情感分析、多轮对话等任务。数据集通过先进的推理模型生成,显著增强了模型在心理学相关任务中的推理能力和生成质量。
GITATTRIBUTESJSONMD Apache License 2.0 43 MiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
tomyzcf/qwen3-finetune-test 已完整同步
这是一个专为Qwen3模型微调设计的高质量数据集,包含两个子集:FineTome-100k(10万条指令遵循数据)和OpenMathReasoning-mini(约1.9万条数学推理数据),采用对话格式,覆盖广泛的知识与推理任务,有助于提升大语言模型的推理能力与知识密集型任务表现。数据集采用Apache 2.0许可证开放使用。
ARROWGITATTRIBUTESJSONMD Apache License 2.0 468 MiB 9 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
opencompass/mmlu 可在线预览 已完整同步
MMLU(大规模多任务语言理解)是一个涵盖57个学科的多选题数据集,用于评估语言模型在广泛知识领域的理解能力。数据集包含问题、四个选项和正确答案,覆盖从抽象代数、天文学到临床知识等众多领域,提供了测试集、验证集和开发集等划分。
GITATTRIBUTESJSONMDPARQUETPYTAR Apache License 2.0 258 MiB 181 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
自我认知微调数据集 可在线预览 已完整同步
这是一个用于自我认知微调的数据集,包含108条中英文对话样本。每条样本都通过可替换的占位符(如模型名称和作者)设计,方便用户自定义和生成专属大模型的自我认知数据。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 29 KiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
这是一个中文句子嵌入模型,能将句子映射到768维的稠密向量空间,适用于文本匹配、语义搜索等任务。它基于MacBERT架构,使用中文语义相似度数据训练,在多个中文文本匹配基准上均表现出不错的性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-19 13:05:10 +00:00