数据集
166 个数据集
热门分类:
RoboMIND2.0-Franka-Part-2 是 Franka 机械臂操作数据分片,包含 HDF5 二进制数据与文本说明,共 22,047 个文件、约 9.81 TB,适合操作技能学习与行为仿真。
心理咨询师数字孪生对话数据集
已完整同步
该数据集包含多轮心理咨询对话,用于构建心理咨询师的数字孪生模型。数据基于少量真实咨询案例,通过大语言模型生成,保留了特定咨询师的语言风格与疗法技术,涵盖单轮与多轮对话。训练集约4760个对话,测试集约240个对话,总计超9万轮次,适合用于微调模型以模拟具有个性化咨询风格的心理健康助理。
Matrix 是面向大语言模型预训练的中英文大规模语料资源,包含多个来源和处理阶段,规模约为数万亿 token。
Egocentric-10K 是目前规模最大的以自我为中心视角的数据集,也是首个完全在真实工厂环境中采集的数据。它包含超过 10,000 小时、约 10.8 亿帧的视频素材,共 192,900 个视频片段,中位时长为 180 秒。视频采用 H.265 编码的 1080p 分辨率,帧率 30 fps,由单目头戴摄像机拍摄,视野为 128° 水平、67° 垂直。数据以 WebDataset 格式存储,每个 tar 包中视频与 JSON 元数据成对出现,并提供基于 OpenCV 鱼眼模型的相机内参。该数据集覆盖 85 个工厂中的多名工人,在手部可见性和主动操作密集度方面达到了当前最优水平。
这是一个中文多轮共情对话数据集,包含约25.8万条对话,共计151万轮交互。对话围绕心理支持、情感倾听与安慰等主题展开,采用多轮对话格式,每条数据包含用户和助手的多轮交流。该数据集旨在提升语言模型的共情、倾听与安慰能力,适用于情感对话相关的研究与训练。
该数据集面向商品文案描述生成任务,属于data-to-text类型,可用于训练模型将商品卖点关键词转化为完整的文案描述。包含3848条测试样本,每条样本由输入的商品卖点词(text1)和输出的文案描述(text2)组成,适合用于生成式文本建模。
RoboMIND2.0-Ark
已完整同步
RoboMIND2.0-Ark 是机器人操作数据分片,包含 HDF5 数据与文本说明,共 14,913 个文件、约 10.45 TB,适合机器人运动规划、仿真和感知研究。
这是一个为训练Llama3中文模型而整合的多源指令微调数据集。它融合了英文通用指令、中文知乎问答、ShareGPT对话、中文常识任务、成语、诗词、逻辑推理、小红书风格文本等多种数据,并统一处理为firefly格式,便于直接训练。数据集包含约169万条清洗后的问答对,支持按需选择子集或合并使用,适合用于提升模型的中文理解和生成能力。
AISHELL-1 trainsets 是中文语音识别训练资源,面向普通话语音转写和 ASR 模型训练,包含训练集相关索引、元数据或说明文件。
Anthropic/hh-rlhf
已完整同步
HH-RLHF数据集包含两类数据:一类是人类偏好数据,用于训练偏好或奖励模型,以支持基于人类反馈的强化学习(RLHF),重点关注助手的帮助性和无害性;另一类是红队测试对话数据,记录了人类与AI的对抗性对话,并附有对对话危害性的标注。这些数据仅供研究使用,不适用于直接训练对话代理,因为可能引发有害行为。数据中可能包含冒犯性或令人不适的内容。
A1233213sswss/rvcmax
已完整同步
A1233213sswss/rvcmax 是 RVC 音色/语音模型资源包,按编号目录提供 WebP 预览图、Yuan 模型文件和 config.json,当前镜像约 1,389 个文件、25.7 GB。
czxxkj/DL3DV-ALL-960P
已完整同步
DL3DV-ALL-960P 是一个包含大量 960P 分辨率图像及其对应相机位姿的数据集,主要用于 3D 视觉领域的研究,如神经辐射场(NeRF)、3D 高斯泼溅、新视角合成以及文本/图像到 3D 的生成等任务。该数据集规模庞大,超过 1TB,覆盖了丰富的真实场景,为 3D 场景理解与重建提供了高质量的训练和评估资源。
这是一个包含训练图像的数据集,主要提供常见图片格式(如jpg、png、jpeg、webp)的文件,并附带一些元数据文件(如json、md),适用于图像处理或机器学习相关任务。
该数据集主要用于LaTeX OCR(光学字符识别)测试,包含图片(PNG格式)以及对应的标注文件(JSON、JSONL等),可用于训练或评估将LaTeX公式图像转换为可编辑文本的模型。
RoboMIND2.0-Franka-Part-1 是 Franka 机械臂操作数据分片,包含 HDF5 数据与文本说明,共 18,684 个文件、约 9.57 TB,适合机器人行为学习与控制研究。
RoboMIND2.0-Franka-Part-3 是一个面向机器人操作任务的数据集,以 HDF5 和文本格式存储数据文件,包含二进制与文本内容,采用 Apache License 2.0 许可。
IndustryCorpus2 是一个覆盖 30 余个行业类别的高质量预训练数据集,包含中文约 1TB、英文约 2.2TB 的文本数据。数据经过规则与模型双重语义质量筛选,并根据质量评估分数划分为高、中、低三个层级,以适配不同场景的模型训练需求。行业分类结合了国民经济行业分类与世界知识体系,涵盖编程、生物医药、法律、金融、数学统计、交通运输、航空航天、制造业等主流领域,旨在为行业大模型提供专业、大规模且高质量的训练语料。
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
modelscope/gsm8k
已完整同步
GSM8K 是小学数学文字题与解答资源,当前镜像包含 JSON、脚本和说明文件,适合数学推理训练样例、模型评测和教育研究。
RoboMIND2.0-Agilex-mobile 是移动操作机器人数据分片,包含 HDF5 数据与文本说明,共 13,952 个文件、约 10.23 TB,面向移动机器人学习与操作研究。