数据集
46 个数据集
热门分类:
OmniThoughtV 是一个大规模多模态长链推理数据集,包含约 180 万条样本。数据集通过蒸馏技术构建,将图像与思维链推理过程相结合,样本格式包含系统提示、用户问题以及助手的逐步推理和最终答案,图像以 base64 编码字符串存储。使用该数据集微调模型,能够有效提升模型在视觉理解和推理任务上的表现,尤其在推理密集型基准上效果显著。
该数据集聚焦于机器人操作任务,包含在家庭场景中使用机械臂拾取纸板箱并放入纸箱的完整过程。数据涵盖402个操作片段、约18.8万帧,提供8个相机视角的视频及状态、动作数据。附有精细的子任务分割、场景描述、末端执行器方向和速度等注释,支持机器人学习与操作技能研究。
IndustryCorpus2 是一个覆盖 30 余个行业类别的高质量预训练数据集,包含中文约 1TB、英文约 2.2TB 的文本数据。数据经过规则与模型双重语义质量筛选,并根据质量评估分数划分为高、中、低三个层级,以适配不同场景的模型训练需求。行业分类结合了国民经济行业分类与世界知识体系,涵盖编程、生物医药、法律、金融、数学统计、交通运输、航空航天、制造业等主流领域,旨在为行业大模型提供专业、大规模且高质量的训练语料。
这是一个高质量的中文预训练语料数据集,专门面向教育领域,包含约9000万条经过严格筛选的文本,总数据量约300GB。该数据集采用类似Fineweb-Edu的构建方法:先利用评分模型评估样本的教育价值,再训练BERT模型对原始数据进行打分,仅保留评分高于4的数据,最后通过MinHash算法进行去重,确保内容质量高、多样性强且无冗余。它适用于中文自然语言处理中的文本生成等任务,尤其适合教育场景下的模型训练和微调。
这是一个用于机器人食品包装任务的协作机器人数据集,基于LeRobot扩展格式。数据由配备两指夹爪的AgileX Cobot机器人采集,在厨房场景中执行抓取、拉、放置、拾取等原子动作。数据集包含798个演示片段,总帧数约147万,涵盖两个主要任务:将午餐盒、黄瓜和梨放入小包装袋,以及将午餐盒、香蕉和面包放入大包装袋,并进一步细分为49个子任务。数据以视频、parquet和JSONL等格式提供,支持中英文描述,适用于机器人模仿学习等研究。
这是一个面向机器人操作任务的精细动作数据集,包含648个完整演示片段,总帧数约36.6万,每秒30帧,数据量约4GB。数据集以试管放置为核心任务,涵盖抓取、放置、传递、移动等多种原子动作,并细分为12个子任务。场景覆盖学校与医院两类环境,配备3个相机视角,且提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的方向、速度、加速度以及夹爪状态等,适合用于机器人模仿学习、动作规划等研究。
这是一个基于 LeRobot 扩展格式的机器人操作数据集,包含 714 个片段(约 41 万帧),记录了在厨房和餐厅场景中,机器人使用两指夹爪完成“倒米”任务的操作过程。任务要求机器人用一只手将碗放至桌子中央,另一只手将米杯中的米倒入碗中,涉及抓取、拾取、放置和倒米等原子动作。数据集包含 3 个视角的视频,并提供了丰富的标注,如子任务分割、场景描述、末端执行器的运动方向/速度/加速度,以及夹爪开合状态等,便于用于机器人学习研究。
这是一个用于机器人操作的数据集,聚焦于“倒米”任务,包含740个演示片段,共计约50万帧,以30帧/秒的速率记录。机器人采用双臂构型,配备两个二指夹爪,在居家和厨房场景中执行抓取、放置、倾倒等原子动作。数据集提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的运动方向与速度、夹爪开合状态等,还包含3个相机视角的同步视频,可用于模仿学习、行为克隆等研究。
该数据集是一个面向机器人操作任务的倒茶数据集,使用兼容LeRobot的扩展格式。机器人类型为 realman_rmc_aidal,配备两指夹爪,在家庭和餐厅场景中采集。数据包含抓取、放置、拾取和倒水四种原子动作,总共有790个演示片段、约55万帧,以及3个视角的同步视频。每个任务都提供了细粒度的子任务分割、场景描述、末端执行器运动方向与速度标注、夹爪状态等丰富注释,适合用于机器人模仿学习与操作技能研究。
该数据集是一个用于机器人操作任务的数据集,专注于将短裤进行折叠。数据由Realman RMC-AIDA-L机器人配合两指夹爪采集,在家庭场景中完成。数据集包含抓取、拾取、折叠、放置等基本原子动作,共计866个演示片段,约73万帧,覆盖4个主要任务和29个细分子任务。数据格式兼容LeRobot,并提供中英文标注。
该数据集是一个面向机器人操作的仿真数据集,基于LeRobot格式扩展,兼容LeRobot工具链。数据使用RealMan RMC-AIDA-L机器人,配备两指夹爪,在厨房场景中执行反复将水果放入碗中再倒出的操作任务。具体任务包括将面包、蛋黄酥、橙子、桃子分别放入蓝色或粉色碗中并重复倒出,共包含8个主要任务和17个细分子任务。数据集共481个演示片段,约54万帧,帧率30fps,总大小3.7GB,并配有3个相机视角的RGB视频。标注信息丰富,包括子任务分割、场景描述、末端执行器的运动方向、速度和加速度分类等,支持多种机器人学习方法。数据集使用Apache-2.0许可证,语言为英文和中文。
这个数据集包含机器人操作演示,使用Realman RM-C AIDAL机械臂与两指夹爪,在家庭和厨房场景中执行抓取、拾取和放置等动作。具体任务涉及用左右夹爪将篮子移至合适位置,再将长条面包放入篮中。数据集共753个回合,约3.9GB,采用LeRobot兼容格式。
该数据集是一个基于LeRobot格式的机器人操作数据集,专注于将眼镜放入眼镜盒的任务。数据包含990个演示片段,共约86万帧,覆盖4种具体任务(如将黑色眼镜放入黑色或绿色眼镜盒)。机器人型号为realman_rmc_aidal,末端采用两指夹爪,场景为家庭环境。原子动作包括抓取、拾取、折叠、关闭和放置等。数据集提供3个相机视角,并带有丰富的标注,包括子任务分割、场景描述以及末端执行器的方向、速度、加速度等信息。
这个数据集包含727个机器人操作演示片段,总时长约30万帧,数据量3.5GB。机器人型号为RealMan RMC-AIDAL,末端执行器为二指夹爪。场景涵盖家庭和厨房环境,涉及抓取、拿起、放置三类基础动作。任务描述围绕左右夹爪配合完成:将篮子水平放置于桌面中央,再将蛋黄酥放入篮子中。数据集包含4个主要任务和18个子任务,提供3个视角的视频记录,适合用于机器人操作学习研究。
这是一个用于机器人操作任务的数据集,包含687个完整记录片段,总计约18万帧图像,数据量3.4GB。数据集聚焦于让协作机器人完成水果沙拉制作中的基本操作,主要任务包括将苹果、香蕉、葡萄、柠檬和芒果放入黑色篮子中,并细分为25个具体子任务,涉及左右夹爪的抓取、拾取和放置动作。所有数据在家庭和厨房场景中采集,使用二指夹爪,并配有3个摄像头视角。数据集提供了丰富的标注信息,如子任务分段、场景描述以及末端执行器运动方向等,格式与LeRobot框架兼容,便于直接用于机器人学习研究。
这个数据集是一个用于机器人操作任务的仿真数据集,基于 LeRobot 格式扩展,完全兼容该生态。数据由 Realman RMC-AIDAL 机器人使用两指夹爪在家庭和厨房场景中采集,包含抓取、拾取和放置等原子动作。总共有 521 个 episode、约 29 万帧、2.6GB 数据量,覆盖 3 个相机视角和 16 个细分子任务(如“左手夹爪抓住香蕉”“右手夹爪将葡萄放入紫色盘子”等)。标注信息丰富,包括子任务分割、场景描述,以及末端执行器的方向、速度、加速度和夹爪开合状态,适合用于模仿学习或多任务机器人策略训练。
这个数据集专注于机器人拧瓶盖操作,囊括了多种饮料瓶(如怡宝、绿茶、康师傅乌龙茶等)的拧紧与拧松任务。机器人采用两指夹爪,在家庭场景中执行抓取、放置和扭转等原子动作。数据集包含863个episode,总计近75万帧,覆盖9个主要任务和50个子任务,以30帧每秒的视频和parquet格式记录,适用于机器人操作学习研究。
这个数据集名为 Split_aloha_pour_tea,是一个专注于机器人倒茶操作的数据集。它包含 977 个完整操作片段,总帧数超过 130 万,涵盖家庭和办公室两种场景。数据集中的机器人执行抓取、放置、拾取和倒茶等原子动作,共有 5 种主要任务(如拿起茶壶向多个茶杯倒茶并放回原位)和 18 个细分子任务。数据通过 3 个相机视角以 30 帧每秒的速度录制,总大小约 13.7 GB,并附带子任务分割与场景描述等丰富标注,适用于机器人学习相关研究。
该数据集展示了AgiBot-g1机器人执行拾取和放置纸箱的任务,具体是将小纸箱拿起并放入大纸箱中。数据包含277个完整演示片段,共计约15万帧,覆盖了从抓取、拾取到放置的多个原子动作。场景为家庭环境,配备8个摄像头视角,提供丰富的RGB视频和状态/动作序列。此外,还包含了子任务分割、场景描述、末端执行器方向与速度、夹爪开合状态等精细化的标注信息,方便用于机器人操作学习。数据集采用LeRobot格式,兼容常见机器人学习框架,总大小约59.5GB。
该数据集为机器人操作任务设计,主要目标是让机械臂完成拾取电池的动作。机器人型号为 ruantong_a2d,末端执行器采用两指夹爪,操作场景设定在工厂环境中。数据集包含 329 个演示片段,总计约 13 万帧画面,帧率为 30fps,提供 8 个相机视角。原子动作涵盖放置、拾取和抓取三类。数据以 LeRobot 格式组织,兼容该框架,并附有丰富的标注信息,包括子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等。