数据集
97 个数据集
热门分类:
该数据集聚焦于机器人操作任务,包含在家庭场景中使用机械臂拾取纸板箱并放入纸箱的完整过程。数据涵盖402个操作片段、约18.8万帧,提供8个相机视角的视频及状态、动作数据。附有精细的子任务分割、场景描述、末端执行器方向和速度等注释,支持机器人学习与操作技能研究。
CAM++ 说话人确认模型基于密集连接时延神经网络,专为中文通用场景设计,在约 200k 说话人的大规模数据集上训练而成。该模型在说话人识别任务中兼顾高性能与高效率,相比主流模型(如 ResNet34、ECAPA-TDNN)在准确率与推理速度上均有优势,可广泛用于说话人确认、说话人日志、语音合成及说话人风格转换等场景。
yiliu666/xiaoduan
已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
这个数据集是为虚拟试衣任务构建的,包含在VITON-HD、VITON和DressCode(上装部分)三个开源数据集图片上重新标注的语义关联关键点。每个数据集均由服饰平铺图片和人像图片组成,其中语义关联的关键点对将人像与服饰的局部语义对应起来。标注采用统一规则,适用于不同款式的服饰,确保相同序号的关键点在不同类型服饰上具有一致语义。每张图片标注了32个关键点,并附带可见、遮挡、不存在三种互斥属性,标注结果以pkl文件格式存储。
该数据集包含从2011年到2014年某电商平台的海量消费者行为数据,涵盖52万件商品、1100多个类目、142万用户及720万条评论与评分。每条评论均包含评论标题、评论内容以及1-5分的评分,可用于训练商品评论情感预测模型。数据集还提供了商品信息、商品类别列表等辅助文件,便于进行细粒度的分析与建模。
魔搭通用SFT数据集是MSAgent-Bench的一个子集,主要涵盖通用问答场景下的监督微调(SFT)数据。每条样本包含一个唯一标识符和对话内容,对话由system、user、assistant三种角色组成,system用于设定模型前置人设,user为用户的输入,assistant为模型的回复。该数据集适用于工具学习、API调用等任务场景,有助于提升模型在复杂交互中的表现。
这个数据集包含约11万条中文对话样本,每条数据由用户提问和模型回答组成,内容涵盖广泛的知识与推理场景。数据基于高性能大语言模型生成,旨在用于微调时作为通用数据集混合,帮助模型保持知识广度、避免遗忘。
基于FST的中文ITN
已完整同步
这是一个基于OpenFST构建的中文逆文本规范化(ITN)模型,支持自定义转换规则,能够将口语化表达(如“二点五平方电线”)转换为标准文本形式。模型通过Python接口调用,方便集成到各类文本处理流程中。
该数据集包含约14.5万条价值观比较样本,每条样本由问题(prompt)、正例回复和负例回复组成,并标注了回复的类型(如“拒绝为主”或“风险回复”)。数据集可用于大模型安全与价值观对齐的相关研究,例如通过正例增强模型安全性、利用正反例训练奖励模型,或构造多项选择题来评估模型表现。数据采用JSONL格式,分为训练和测试两部分。
Robin021/DISC-Law-SFT
已完整同步
这是一个面向中文法律智能系统的高质量监督微调数据集,覆盖法律信息提取、判决预测、文档摘要和问答等任务。数据集包含两个子集:一个用于引入法律推理能力,另一个用于增强模型利用外部法律知识的能力。整体规模超过100万条,以中文问答和任务对话形式呈现,适合用于训练和评估法律领域的语言模型。
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
这个数据集专为 LaTeX 光学字符识别(OCR)任务设计,包含图像到文本的配对样本。它提供了多种子集:一个约 100K 样本的印刷体完整数据集,一个同样规模的手写体合成数据集,以及一个较小但更贴近真实手写场景的数据集。此外,还有一个小规模测试集(110 条)和基于真实手写公式渲染的印刷体版本。每个子集都划分为训练、验证和测试三部分,方便模型训练与评估。
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。
匠数科技大模型SFT数据集是一个经过精心整理和严格审核的高质量中文及英文数据集,专为大型语言模型的监督微调(SFT)任务设计。该数据集汇总了众多开源数据,经过格式统一、清洗和内容安全筛查,最终包含超过12M条样本,并按任务类型划分为50个类别,每条样本均包含指令、输入、输出、历史对话等结构化字段,方便用户直接用于训练和评估。数据集覆盖广泛的中文任务,同时英文数据也经过单独整理,兼顾了跨语言翻译等场景,为SFT研究提供了安全、统一、易用的资源。
modelscope/mmlu
已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
该数据集是一个用于图像描述(image captioning)任务的数据集,包含训练和验证两个子集。每条数据由图像、对应的描述文本以及图像ID组成,适合用于训练和评估图像描述模型。数据集规模在10k到1m之间,语言为英文。
该数据集包含超过14万张带中文标签的生活垃圾图像,覆盖可回收垃圾、厨余垃圾、有害垃圾和其他垃圾4个标准大类,细分为265个常见生活垃圾小类。其中训练集约13.3万张,验证集约1.46万张,数据总量约13GB。图像按类别存放在不同文件夹中,并附带中文类名文件,方便直接用于垃圾分类模型的训练与评估。
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。