数据集

24 个数据集
已选筛选: CSV 清除所有筛选
social-media-impact-on-mental-health 可在线预览 已完整同步
这个数据集聚焦于青少年心理健康与社交媒体使用之间的关系,包含1200名13至19岁青少年的行为与心理指标。数据涵盖社交媒体使用时长、首选平台、睡眠时长、身体活动水平、学业表现、压力与焦虑程度,以及抑郁状态标签。通过分析这些变量,可以观察到睡眠不足、过度使用社交媒体、高压力焦虑与抑郁倾向之间的关联,同时身体活动似乎对心理健康具有一定保护作用。该数据集适用于探索影响青少年心理健康的多种因素,支持分类、回归或相关性分析等任务。
CSV MIT License 61 KiB 1 个文件 WeHub 同步于 2026-09-10 15:03:26 +00:00
fifa-world-cup-2026-player-performance-dataset 可在线预览 已完整同步
这个数据集收录了2026年世界杯期间球员的详细表现数据,涵盖个人属性、比赛参与记录、进攻与防守统计、传球与射门指标、门将数据、纪律情况以及体能表现等。无论是用于构建球员评分模型、分析比赛走势,还是进行战术评估与可视化展示,都能提供丰富的分析基础。适合体育数据分析、机器学习和足球研究等多种场景。
CSV MIT License 16 MiB 1 个文件 WeHub 同步于 2026-09-10 09:48:48 +00:00
fifa-world-cup-2026-dataset 可在线预览 已完整同步
该数据集覆盖2026年世界杯全部104场比赛,包含48支球队、1248名球员的完整信息,并实时更新比赛结果、预期进球(xG)、逐分钟事件、球队统计等。数据采用关系型结构,便于SQL建模,可服务于体育分析、机器学习预测及可视化展示。
CSV CC0 1.0 Universal 472 KiB 14 个文件 WeHub 同步于 2026-09-09 19:48:43 +00:00
kepler-exoplanet-search-results 可在线预览 已完整同步
该数据集包含开普勒太空望远镜观测到的约10,000个系外行星候选体的累积记录,涵盖候选体名称、处置状态(候选、误报、已确认)及置信度评分等关键信息。适用于分析系外行星确认与误报的规律,探索行星候选体的特征分布,以及研究命名和置信度评分模式。
CSV CC0 1.0 Universal 3.5 MiB 1 个文件 WeHub 同步于 2026-09-08 17:33:22 +00:00
fka/prompts.chat 可在线预览 已完整同步
这是一个由社区贡献的AI提示词(prompts)数据集,包含大量用户分享的各类对话提示,适用于ChatGPT、Claude、Gemini、Llama、Mistral等主流AI聊天模型。数据覆盖问答和文本生成任务,规模在10万到100万条之间,提供CSV等格式,方便直接使用和分析。
CSVGITATTRIBUTESMD CC0 1.0 Universal 5.5 MiB 3 个文件 WeHub 同步于 2026-09-07 07:03:50 +00:00
L3 tmp D2 可在线预览 已完整同步
该数据集采用多种格式(bin、csv、jsonl)存储,内容涵盖模型、表格数据和结构化文本,且记录可读,便于灵活调用与分析。
BINCSVJSONL MIT License 149 B 4 个文件 WeHub 同步于 2026-09-03 12:20:44 +00:00
L3 tmp D4 可在线预览 已完整同步
这份数据集以 L3 tmp D4 为标题,提供 CSV 与二进制(bin)两种格式,内容涵盖表格型数据与模型。数据记录可读,便于直接使用与分析。
BINCSV MIT License 5.1 KiB 4 个文件 WeHub 同步于 2026-09-03 12:10:54 +00:00
L3 tmp D1 可在线预览 已完整同步
这是一个名为“L3 tmp D1”的数据集,包含二进制、CSV 和 JSONL 三种格式,覆盖模型、表格和结构化文本三类内容。数据集中的记录可读,便于直接使用。
BINCSVJSONL MIT License 124 B 3 个文件 WeHub 同步于 2026-09-03 12:10:49 +00:00
基于语义关联的人像和服饰关键点 可在线预览 已完整同步
这个数据集是为虚拟试衣任务构建的,包含在VITON-HD、VITON和DressCode(上装部分)三个开源数据集图片上重新标注的语义关联关键点。每个数据集均由服饰平铺图片和人像图片组成,其中语义关联的关键点对将人像与服饰的局部语义对应起来。标注采用统一规则,适用于不同款式的服饰,确保相同序号的关键点在不同类型服饰上具有一致语义。每张图片标注了32个关键点,并附带可见、遮挡、不存在三种互斥属性,标注结果以pkl文件格式存储。
CSVJSONMDPNG Apache License 2.0 25 MiB 10 个文件 WeHub 同步于 2026-08-22 04:58:19 +00:00
商品评论情感预测 可在线预览 已完整同步
该数据集包含从2011年到2014年某电商平台的海量消费者行为数据,涵盖52万件商品、1100多个类目、142万用户及720万条评论与评分。每条评论均包含评论标题、评论内容以及1-5分的评分,可用于训练商品评论情感预测模型。数据集还提供了商品信息、商品类别列表等辅助文件,便于进行细粒度的分析与建模。
CSVJSONMD Apache License 2.0 5.6 MiB 4 个文件 WeHub 同步于 2026-08-20 15:34:55 +00:00
ChatGLM评估挑战赛-金融赛道数据集 可在线预览 已完整同步
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。
CSVGITATTRIBUTESJSONJSONLMDPDF Apache License 2.0 69 GiB 11598 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
中文生活垃圾分类数据集 可在线预览 已完整同步
该数据集包含超过14万张带中文标签的生活垃圾图像,覆盖可回收垃圾、厨余垃圾、有害垃圾和其他垃圾4个标准大类,细分为265个常见生活垃圾小类。其中训练集约13.3万张,验证集约1.46万张,数据总量约13GB。图像按类别存放在不同文件夹中,并附带中文类名文件,方便直接用于垃圾分类模型的训练与评估。
CSVJPGJSONMDTXT Apache License 2.0 5.2 MiB 7 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
tany0699/fruits100 可在线预览 已完整同步
这个数据集包含了100种不同水果的图像,可用于图像分类任务的训练、验证和性能评估。数据集分为训练集和验证集,图片按类别存放在对应的文件夹中,格式为JPG。同时提供类名文件,方便标注对应关系。
CSVJSONMDTXT Apache License 2.0 1.2 MiB 7 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
lcl193798/product_description_generation 可在线预览 已完整同步
该数据集面向商品文案描述生成任务,属于data-to-text类型,可用于训练模型将商品卖点关键词转化为完整的文案描述。包含3848条测试样本,每条样本由输入的商品卖点词(text1)和输出的文案描述(text2)组成,适合用于生成式文本建模。
CSVJSONMD Apache License 2.0 1.3 MiB 4 个文件 WeHub 同步于 2026-08-20 02:28:19 +00:00
中文语音识别Aishell-1学术数据集训练集 可在线预览 已完整同步
AISHELL-1 trainsets 是中文语音识别训练资源,面向普通话语音转写和 ASR 模型训练,包含训练集相关索引、元数据或说明文件。
CSVJSONMD Apache License 2.0 17 MiB 6 个文件 WeHub 同步于 2026-08-20 02:03:47 +00:00
中文诗词数据集 可在线预览 已完整同步
这是一个中文诗词数据集,收录了从中国古代各朝代的诗词作品,可用于训练诗词续写模型。数据集包含约38.9万条训练样本和1710条测试样本,每条记录以“text1”字段存储一段完整的诗词内容。数据格式支持CSV、JSON和Markdown,便于不同场景下的使用。
CSVJSONMD Apache License 2.0 42 MiB 5 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
中文Text2SQL数据集 可在线预览 已完整同步
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
CSVJSONMDPNG Apache License 2.0 1.3 MiB 6 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
lvjianjin/AdvertiseGen 可在线预览 已完整同步
这是一个用于广告文案生成的中文数据集,基于商品网页的标签与文案信息对应关系构建。任务属于典型的开放式文本生成:给定商品的关键词和属性列表(key-value形式),模型需要生成与输入信息保持事实一致性的广告文案。数据集包含训练集约114k条、验证集1k条、测试集3k条,每条数据由商品属性列表(content)和对应广告文案(summary)组成。
CSVJSONMD Apache License 2.0 36 MiB 5 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
tany0699/cats_and_dogs 可在线预览 已完整同步
这是一个轻量级的猫狗二分类图像数据集,共包含两个类别。训练集有275张带标注的图片,验证集有70张,整个数据集大小约10.3MB。图片按类别分别存放在 `train` 和 `val` 文件夹下,格式为 JPG,并附带类别名称文件。由于数据量小,非常适合快速模型验证、性能评估或小规模训练实验。
CSVJSONMDTXT Apache License 2.0 26 KiB 6 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
本数据集收录了高校录取分数和位次信息,字段齐全、数据规模充足,适合用于高校招生与录取相关分析。使用时需注意按派生或索引口径进行处理。数据提供 JSON、CSV 等多种格式。
CSVGITIGNOREJSJSONMDPY 104 MiB 2712 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00