数据集

25 个数据集
已选筛选: JSON Apache License 2.0 清除所有筛选
lvjianjin/AdvertiseGen 可在线预览 已完整同步
这是一个用于广告文案生成的中文数据集,基于商品网页的标签与文案信息对应关系构建。任务属于典型的开放式文本生成:给定商品的关键词和属性列表(key-value形式),模型需要生成与输入信息保持事实一致性的广告文案。数据集包含训练集约114k条、验证集1k条、测试集3k条,每条数据由商品属性列表(content)和对应广告文案(summary)组成。
CSVJSONMD Apache License 2.0 36 MiB 5 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
tany0699/cats_and_dogs 可在线预览 已完整同步
这是一个轻量级的猫狗二分类图像数据集,共包含两个类别。训练集有275张带标注的图片,验证集有70张,整个数据集大小约10.3MB。图片按类别分别存放在 `train` 和 `val` 文件夹下,格式为 JPG,并附带类别名称文件。由于数据量小,非常适合快速模型验证、性能评估或小规模训练实验。
CSVJSONMDTXT Apache License 2.0 26 KiB 6 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
该数据集专为心理健康领域设计,包含10,000条中文高质量样本。每条数据由用户输入、推理思维链和最终输出三部分组成,适用于心理咨询、情感分析、多轮对话等任务。数据集通过先进的推理模型生成,显著增强了模型在心理学相关任务中的推理能力和生成质量。
GITATTRIBUTESJSONMD Apache License 2.0 43 MiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
tomyzcf/qwen3-finetune-test 已完整同步
这是一个专为Qwen3模型微调设计的高质量数据集,包含两个子集:FineTome-100k(10万条指令遵循数据)和OpenMathReasoning-mini(约1.9万条数学推理数据),采用对话格式,覆盖广泛的知识与推理任务,有助于提升大语言模型的推理能力与知识密集型任务表现。数据集采用Apache 2.0许可证开放使用。
ARROWGITATTRIBUTESJSONMD Apache License 2.0 468 MiB 9 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
opencompass/mmlu 可在线预览 已完整同步
MMLU(大规模多任务语言理解)是一个涵盖57个学科的多选题数据集,用于评估语言模型在广泛知识领域的理解能力。数据集包含问题、四个选项和正确答案,覆盖从抽象代数、天文学到临床知识等众多领域,提供了测试集、验证集和开发集等划分。
GITATTRIBUTESJSONMDPARQUETPYTAR Apache License 2.0 258 MiB 181 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00