数据集
9 个数据集
热门分类:
这个数据集是为虚拟试衣任务构建的,包含在VITON-HD、VITON和DressCode(上装部分)三个开源数据集图片上重新标注的语义关联关键点。每个数据集均由服饰平铺图片和人像图片组成,其中语义关联的关键点对将人像与服饰的局部语义对应起来。标注采用统一规则,适用于不同款式的服饰,确保相同序号的关键点在不同类型服饰上具有一致语义。每张图片标注了32个关键点,并附带可见、遮挡、不存在三种互斥属性,标注结果以pkl文件格式存储。
该数据集包含从2011年到2014年某电商平台的海量消费者行为数据,涵盖52万件商品、1100多个类目、142万用户及720万条评论与评分。每条评论均包含评论标题、评论内容以及1-5分的评分,可用于训练商品评论情感预测模型。数据集还提供了商品信息、商品类别列表等辅助文件,便于进行细粒度的分析与建模。
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。
该数据集包含超过14万张带中文标签的生活垃圾图像,覆盖可回收垃圾、厨余垃圾、有害垃圾和其他垃圾4个标准大类,细分为265个常见生活垃圾小类。其中训练集约13.3万张,验证集约1.46万张,数据总量约13GB。图像按类别存放在不同文件夹中,并附带中文类名文件,方便直接用于垃圾分类模型的训练与评估。
AISHELL-1 trainsets 是中文语音识别训练资源,面向普通话语音转写和 ASR 模型训练,包含训练集相关索引、元数据或说明文件。
这是一个中文诗词数据集,收录了从中国古代各朝代的诗词作品,可用于训练诗词续写模型。数据集包含约38.9万条训练样本和1710条测试样本,每条记录以“text1”字段存储一段完整的诗词内容。数据格式支持CSV、JSON和Markdown,便于不同场景下的使用。
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
High_Dimensional_Time_Series 是多变量时间序列预测数据集,包含 M5、伦敦智能电表、Wikipedia 流量、全球温度和风速等序列配置。
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。