数据集

9 个数据集
已选筛选: CSV apache-2.0 清除所有筛选
基于语义关联的人像和服饰关键点 可在线预览 已完整同步
这个数据集是为虚拟试衣任务构建的,包含在VITON-HD、VITON和DressCode(上装部分)三个开源数据集图片上重新标注的语义关联关键点。每个数据集均由服饰平铺图片和人像图片组成,其中语义关联的关键点对将人像与服饰的局部语义对应起来。标注采用统一规则,适用于不同款式的服饰,确保相同序号的关键点在不同类型服饰上具有一致语义。每张图片标注了32个关键点,并附带可见、遮挡、不存在三种互斥属性,标注结果以pkl文件格式存储。
CSVJSONMDPNG Apache License 2.0 25 MiB 10 个文件 WeHub 同步于 2026-08-22 04:58:19 +00:00
商品评论情感预测 可在线预览 已完整同步
该数据集包含从2011年到2014年某电商平台的海量消费者行为数据,涵盖52万件商品、1100多个类目、142万用户及720万条评论与评分。每条评论均包含评论标题、评论内容以及1-5分的评分,可用于训练商品评论情感预测模型。数据集还提供了商品信息、商品类别列表等辅助文件,便于进行细粒度的分析与建模。
CSVJSONMD Apache License 2.0 5.6 MiB 4 个文件 WeHub 同步于 2026-08-20 15:34:55 +00:00
ChatGLM评估挑战赛-金融赛道数据集 可在线预览 已完整同步
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。
CSVGITATTRIBUTESJSONJSONLMDPDF Apache License 2.0 69 GiB 11598 个文件 WeHub 同步于 2026-08-20 09:19:37 +00:00
中文生活垃圾分类数据集 可在线预览 已完整同步
该数据集包含超过14万张带中文标签的生活垃圾图像,覆盖可回收垃圾、厨余垃圾、有害垃圾和其他垃圾4个标准大类,细分为265个常见生活垃圾小类。其中训练集约13.3万张,验证集约1.46万张,数据总量约13GB。图像按类别存放在不同文件夹中,并附带中文类名文件,方便直接用于垃圾分类模型的训练与评估。
CSVJPGJSONMDTXT Apache License 2.0 5.2 MiB 7 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
中文语音识别Aishell-1学术数据集训练集 可在线预览 已完整同步
AISHELL-1 trainsets 是中文语音识别训练资源,面向普通话语音转写和 ASR 模型训练,包含训练集相关索引、元数据或说明文件。
CSVJSONMD Apache License 2.0 17 MiB 6 个文件 WeHub 同步于 2026-08-20 02:03:47 +00:00
中文诗词数据集 可在线预览 已完整同步
这是一个中文诗词数据集,收录了从中国古代各朝代的诗词作品,可用于训练诗词续写模型。数据集包含约38.9万条训练样本和1710条测试样本,每条记录以“text1”字段存储一段完整的诗词内容。数据格式支持CSV、JSON和Markdown,便于不同场景下的使用。
CSVJSONMD Apache License 2.0 42 MiB 5 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
中文Text2SQL数据集 可在线预览 已完整同步
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
CSVJSONMDPNG Apache License 2.0 1.3 MiB 6 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
Time-HD-Anonymous/High_Dimensional_Time_Series 可在线预览 已完整同步
High_Dimensional_Time_Series 是多变量时间序列预测数据集,包含 M5、伦敦智能电表、Wikipedia 流量、全球温度和风速等序列配置。
CSVGITATTRIBUTESMD Apache License 2.0 16 GiB 30 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00