数据集
97 个数据集
热门分类:
心理咨询师数字孪生对话数据集
已完整同步
该数据集包含多轮心理咨询对话,用于构建心理咨询师的数字孪生模型。数据基于少量真实咨询案例,通过大语言模型生成,保留了特定咨询师的语言风格与疗法技术,涵盖单轮与多轮对话。训练集约4760个对话,测试集约240个对话,总计超9万轮次,适合用于微调模型以模拟具有个性化咨询风格的心理健康助理。
Matrix 是面向大语言模型预训练的中英文大规模语料资源,包含多个来源和处理阶段,规模约为数万亿 token。
Egocentric-10K 是目前规模最大的以自我为中心视角的数据集,也是首个完全在真实工厂环境中采集的数据。它包含超过 10,000 小时、约 10.8 亿帧的视频素材,共 192,900 个视频片段,中位时长为 180 秒。视频采用 H.265 编码的 1080p 分辨率,帧率 30 fps,由单目头戴摄像机拍摄,视野为 128° 水平、67° 垂直。数据以 WebDataset 格式存储,每个 tar 包中视频与 JSON 元数据成对出现,并提供基于 OpenCV 鱼眼模型的相机内参。该数据集覆盖 85 个工厂中的多名工人,在手部可见性和主动操作密集度方面达到了当前最优水平。
RoboMIND2.0-Ark
已完整同步
RoboMIND2.0-Ark 是机器人操作数据分片,包含 HDF5 数据与文本说明,共 14,913 个文件、约 10.45 TB,适合机器人运动规划、仿真和感知研究。
AISHELL-1 trainsets 是中文语音识别训练资源,面向普通话语音转写和 ASR 模型训练,包含训练集相关索引、元数据或说明文件。
RoboMIND2.0-Franka-Part-1 是 Franka 机械臂操作数据分片,包含 HDF5 数据与文本说明,共 18,684 个文件、约 9.57 TB,适合机器人行为学习与控制研究。
RoboMIND2.0-Franka-Part-3 是一个面向机器人操作任务的数据集,以 HDF5 和文本格式存储数据文件,包含二进制与文本内容,采用 Apache License 2.0 许可。
IndustryCorpus2 是一个覆盖 30 余个行业类别的高质量预训练数据集,包含中文约 1TB、英文约 2.2TB 的文本数据。数据经过规则与模型双重语义质量筛选,并根据质量评估分数划分为高、中、低三个层级,以适配不同场景的模型训练需求。行业分类结合了国民经济行业分类与世界知识体系,涵盖编程、生物医药、法律、金融、数学统计、交通运输、航空航天、制造业等主流领域,旨在为行业大模型提供专业、大规模且高质量的训练语料。
这是一个高质量的中文预训练语料数据集,专门面向教育领域,包含约9000万条经过严格筛选的文本,总数据量约300GB。该数据集采用类似Fineweb-Edu的构建方法:先利用评分模型评估样本的教育价值,再训练BERT模型对原始数据进行打分,仅保留评分高于4的数据,最后通过MinHash算法进行去重,确保内容质量高、多样性强且无冗余。它适用于中文自然语言处理中的文本生成等任务,尤其适合教育场景下的模型训练和微调。
这是一个中文诗词数据集,收录了从中国古代各朝代的诗词作品,可用于训练诗词续写模型。数据集包含约38.9万条训练样本和1710条测试样本,每条记录以“text1”字段存储一段完整的诗词内容。数据格式支持CSV、JSON和Markdown,便于不同场景下的使用。
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
这是一个中文数据集,包含约11万条从DeepSeek-R1蒸馏得到的指令-回答对,已整合为可直接用于监督微调(SFT)的格式。数据涵盖数学、考试、STEM及通用领域(如逻辑推理、小红书、知乎等),并保留了模型打分结果(如正确性、无害性、有用性),便于后续筛选。请注意,数据由模型生成,未经严格验证,使用时需自行甄别。
这是一个用于自我认知微调的数据集,包含108条中英文对话样本。每条样本都通过可替换的占位符(如模型名称和作者)设计,方便用户自定义和生成专属大模型的自我认知数据。
ShoufaChen/goku_demos
已完整同步
goku_demos 是动作/视频演示资源,当前镜像包含 MP4 视频、文本和说明文件,共 1,141 个文件、约 876 MB,适合演示和验证相关数据处理流程。
这是一个用于机器人食品包装任务的协作机器人数据集,基于LeRobot扩展格式。数据由配备两指夹爪的AgileX Cobot机器人采集,在厨房场景中执行抓取、拉、放置、拾取等原子动作。数据集包含798个演示片段,总帧数约147万,涵盖两个主要任务:将午餐盒、黄瓜和梨放入小包装袋,以及将午餐盒、香蕉和面包放入大包装袋,并进一步细分为49个子任务。数据以视频、parquet和JSONL等格式提供,支持中英文描述,适用于机器人模仿学习等研究。
这是一个面向机器人操作任务的精细动作数据集,包含648个完整演示片段,总帧数约36.6万,每秒30帧,数据量约4GB。数据集以试管放置为核心任务,涵盖抓取、放置、传递、移动等多种原子动作,并细分为12个子任务。场景覆盖学校与医院两类环境,配备3个相机视角,且提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的方向、速度、加速度以及夹爪状态等,适合用于机器人模仿学习、动作规划等研究。
这是一个基于 LeRobot 扩展格式的机器人操作数据集,包含 714 个片段(约 41 万帧),记录了在厨房和餐厅场景中,机器人使用两指夹爪完成“倒米”任务的操作过程。任务要求机器人用一只手将碗放至桌子中央,另一只手将米杯中的米倒入碗中,涉及抓取、拾取、放置和倒米等原子动作。数据集包含 3 个视角的视频,并提供了丰富的标注,如子任务分割、场景描述、末端执行器的运动方向/速度/加速度,以及夹爪开合状态等,便于用于机器人学习研究。
这是一个用于机器人操作的数据集,聚焦于“倒米”任务,包含740个演示片段,共计约50万帧,以30帧/秒的速率记录。机器人采用双臂构型,配备两个二指夹爪,在居家和厨房场景中执行抓取、放置、倾倒等原子动作。数据集提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的运动方向与速度、夹爪开合状态等,还包含3个相机视角的同步视频,可用于模仿学习、行为克隆等研究。
该数据集是一个面向机器人操作任务的倒茶数据集,使用兼容LeRobot的扩展格式。机器人类型为 realman_rmc_aidal,配备两指夹爪,在家庭和餐厅场景中采集。数据包含抓取、放置、拾取和倒水四种原子动作,总共有790个演示片段、约55万帧,以及3个视角的同步视频。每个任务都提供了细粒度的子任务分割、场景描述、末端执行器运动方向与速度标注、夹爪状态等丰富注释,适合用于机器人模仿学习与操作技能研究。
该数据集是一个用于机器人操作任务的数据集,专注于将短裤进行折叠。数据由Realman RMC-AIDA-L机器人配合两指夹爪采集,在家庭场景中完成。数据集包含抓取、拾取、折叠、放置等基本原子动作,共计866个演示片段,约73万帧,覆盖4个主要任务和29个细分子任务。数据格式兼容LeRobot,并提供中英文标注。