数据集

170 个数据集
已选筛选: 数据集 清除所有筛选
fifa-world-cup-2026-player-performance-dataset 可在线预览 已完整同步
这个数据集收录了2026年世界杯期间球员的详细表现数据,涵盖个人属性、比赛参与记录、进攻与防守统计、传球与射门指标、门将数据、纪律情况以及体能表现等。无论是用于构建球员评分模型、分析比赛走势,还是进行战术评估与可视化展示,都能提供丰富的分析基础。适合体育数据分析、机器学习和足球研究等多种场景。
CSV MIT License 16 MiB 1 个文件 WeHub 同步于 2026-09-10 09:48:48 +00:00
fifa-world-cup-2026-dataset 可在线预览 已完整同步
该数据集覆盖2026年世界杯全部104场比赛,包含48支球队、1248名球员的完整信息,并实时更新比赛结果、预期进球(xG)、逐分钟事件、球队统计等。数据采用关系型结构,便于SQL建模,可服务于体育分析、机器学习预测及可视化展示。
CSV CC0 1.0 Universal 472 KiB 14 个文件 WeHub 同步于 2026-09-09 19:48:43 +00:00
social-media-impact-on-mental-health 可在线预览 已完整同步
这个数据集聚焦于青少年心理健康与社交媒体使用之间的关系,包含1200名13至19岁青少年的行为与心理指标。数据涵盖社交媒体使用时长、首选平台、睡眠时长、身体活动水平、学业表现、压力与焦虑程度,以及抑郁状态标签。通过分析这些变量,可以观察到睡眠不足、过度使用社交媒体、高压力焦虑与抑郁倾向之间的关联,同时身体活动似乎对心理健康具有一定保护作用。该数据集适用于探索影响青少年心理健康的多种因素,支持分类、回归或相关性分析等任务。
CSV MIT License 61 KiB 1 个文件 WeHub 同步于 2026-09-09 13:49:18 +00:00
kepler-exoplanet-search-results 可在线预览 已完整同步
该数据集包含开普勒太空望远镜观测到的约10,000个系外行星候选体的累积记录,涵盖候选体名称、处置状态(候选、误报、已确认)及置信度评分等关键信息。适用于分析系外行星确认与误报的规律,探索行星候选体的特征分布,以及研究命名和置信度评分模式。
CSV CC0 1.0 Universal 3.5 MiB 1 个文件 WeHub 同步于 2026-09-08 17:33:22 +00:00
alibaba-pai/OmmiThoughtV_Raw_1.8M 可在线预览 已完整同步
OmniThoughtV 是一个大规模多模态长链推理数据集,包含约 180 万条样本。数据集通过蒸馏技术构建,将图像与思维链推理过程相结合,样本格式包含系统提示、用户问题以及助手的逐步推理和最终答案,图像以 base64 编码字符串存储。使用该数据集微调模型,能够有效提升模型在视觉理解和推理任务上的表现,尤其在推理密集型基准上效果显著。
GITATTRIBUTESKEEPMDPARQUET Apache License 2.0 548 GiB 94 个文件 WeHub 同步于 2026-09-08 00:16:52 +00:00
fka/prompts.chat 可在线预览 已完整同步
这是一个由社区贡献的AI提示词(prompts)数据集,包含大量用户分享的各类对话提示,适用于ChatGPT、Claude、Gemini、Llama、Mistral等主流AI聊天模型。数据覆盖问答和文本生成任务,规模在10万到100万条之间,提供CSV等格式,方便直接使用和分析。
CSVGITATTRIBUTESMD CC0 1.0 Universal 5.5 MiB 3 个文件 WeHub 同步于 2026-09-07 07:03:50 +00:00
L3 tmp D2 可在线预览 已完整同步
该数据集采用多种格式(bin、csv、jsonl)存储,内容涵盖模型、表格数据和结构化文本,且记录可读,便于灵活调用与分析。
BINCSVJSONL MIT License 149 B 4 个文件 WeHub 同步于 2026-09-03 12:20:44 +00:00
L3 tmp D5 restricted 部分同步
这是一个名为“L3 tmp D5 restricted”的临时数据集,属于L3级别,可能带有访问限制。
MIT License WeHub 同步于 2026-09-03 12:10:59 +00:00
L3 tmp D4 可在线预览 已完整同步
这份数据集以 L3 tmp D4 为标题,提供 CSV 与二进制(bin)两种格式,内容涵盖表格型数据与模型。数据记录可读,便于直接使用与分析。
BINCSV MIT License 5.1 KiB 4 个文件 WeHub 同步于 2026-09-03 12:10:54 +00:00
L3 tmp D1 可在线预览 已完整同步
这是一个名为“L3 tmp D1”的数据集,包含二进制、CSV 和 JSONL 三种格式,覆盖模型、表格和结构化文本三类内容。数据集中的记录可读,便于直接使用。
BINCSVJSONL MIT License 124 B 3 个文件 WeHub 同步于 2026-09-03 12:10:49 +00:00
rs-accept http file 已完整同步
该数据集包含用于接受测试的HTTP文件,数据格式为二进制,不可直接读取。内容涉及HTTP文件传输的验证场景。
MIT License 1.2 KiB 1 个文件 WeHub 同步于 2026-09-02 08:28:22 +00:00
AgiBot-g1_box_storage_cardboard_box_a 可在线预览 已完整同步
该数据集聚焦于机器人操作任务,包含在家庭场景中使用机械臂拾取纸板箱并放入纸箱的完整过程。数据涵盖402个操作片段、约18.8万帧,提供8个相机视角的视频及状态、动作数据。附有精细的子任务分割、场景描述、末端执行器方向和速度等注释,支持机器人学习与操作技能研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 88 GiB 3631 个文件 WeHub 同步于 2026-09-02 07:05:11 +00:00
CAM++ 说话人确认模型基于密集连接时延神经网络,专为中文通用场景设计,在约 200k 说话人的大规模数据集上训练而成。该模型在说话人识别任务中兼顾高性能与高效率,相比主流模型(如 ResNet34、ECAPA-TDNN)在准确率与推理速度上均有优势,可广泛用于说话人确认、说话人日志、语音合成及说话人风格转换等场景。
BINGITATTRIBUTESJSONMDPNGTXTWAVYAML Apache License 2.0 28 MiB 12 个文件 WeHub 同步于 2026-08-30 00:33:31 +00:00
yiliu666/xiaoduan 已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
APKDMGEXEGITATTRIBUTESHTMLJSJSONMDPCKPDFPKGPNGPYTXTWASMZIP Apache License 2.0 3.8 GiB 63 个文件 WeHub 同步于 2026-08-22 18:38:19 +00:00
基于语义关联的人像和服饰关键点 可在线预览 已完整同步
这个数据集是为虚拟试衣任务构建的,包含在VITON-HD、VITON和DressCode(上装部分)三个开源数据集图片上重新标注的语义关联关键点。每个数据集均由服饰平铺图片和人像图片组成,其中语义关联的关键点对将人像与服饰的局部语义对应起来。标注采用统一规则,适用于不同款式的服饰,确保相同序号的关键点在不同类型服饰上具有一致语义。每张图片标注了32个关键点,并附带可见、遮挡、不存在三种互斥属性,标注结果以pkl文件格式存储。
CSVJSONMDPNG Apache License 2.0 25 MiB 10 个文件 WeHub 同步于 2026-08-22 04:58:19 +00:00
商品评论情感预测 可在线预览 已完整同步
该数据集包含从2011年到2014年某电商平台的海量消费者行为数据,涵盖52万件商品、1100多个类目、142万用户及720万条评论与评分。每条评论均包含评论标题、评论内容以及1-5分的评分,可用于训练商品评论情感预测模型。数据集还提供了商品信息、商品类别列表等辅助文件,便于进行细粒度的分析与建模。
CSVJSONMD Apache License 2.0 5.6 MiB 4 个文件 WeHub 同步于 2026-08-20 15:34:55 +00:00
魔搭通用SFT数据集 可在线预览 已完整同步
魔搭通用SFT数据集是MSAgent-Bench的一个子集,主要涵盖通用问答场景下的监督微调(SFT)数据。每条样本包含一个唯一标识符和对话内容,对话由system、user、assistant三种角色组成,system用于设定模型前置人设,user为用户的输入,assistant为模型的回复。该数据集适用于工具学习、API调用等任务场景,有助于提升模型在复杂交互中的表现。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 514 MiB 5 个文件 WeHub 同步于 2026-08-20 15:13:43 +00:00
中文基于Qwen3-235B-2507蒸馏数据集 可在线预览 已完整同步
这个数据集包含约11万条中文对话样本,每条数据由用户提问和模型回答组成,内容涵盖广泛的知识与推理场景。数据基于高性能大语言模型生成,旨在用于微调时作为通用数据集混合,帮助模型保持知识广度、避免遗忘。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 528 MiB 4 个文件 WeHub 同步于 2026-08-20 15:13:43 +00:00
基于FST的中文ITN 已完整同步
这是一个基于OpenFST构建的中文逆文本规范化(ITN)模型,支持自定义转换规则,能够将口语化表达(如“二点五平方电线”)转换为标准文本形式。模型通过Python接口调用,方便集成到各类文本处理流程中。
FSTGITATTRIBUTESJSONMD Apache License 2.0 871 KiB 5 个文件 WeHub 同步于 2026-08-20 10:48:19 +00:00
该数据集包含约14.5万条价值观比较样本,每条样本由问题(prompt)、正例回复和负例回复组成,并标注了回复的类型(如“拒绝为主”或“风险回复”)。数据集可用于大模型安全与价值观对齐的相关研究,例如通过正例增强模型安全性、利用正反例训练奖励模型,或构造多项选择题来评估模型表现。数据采用JSONL格式,分为训练和测试两部分。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 266 MiB 5 个文件 WeHub 同步于 2026-08-20 09:38:19 +00:00