数据集
142 个数据集
热门分类:
这是一个面向机器人操作任务的数据集,使用真实机器人(RealMan RMC-AIDA-L)配合两指夹爪采集,覆盖家庭和餐厅两种场景。数据集包含776个演示片段,总帧数超过51万,记录了抓取、拾取、放置和擦拭四种原子动作,并针对“用抹布擦除桌面污渍”这一主要任务设计了多种子任务(如用不同颜色的抹布擦除不同颜色的污渍)。数据以30 FPS保存,附带3个摄像头视角的影像,以及丰富的子任务分段、场景描述、末端执行器运动状态和夹爪状态等标注信息,便于用于机器人技能学习研究。
Fineweb-Edu-Chinese-V2.1
已完整同步
Fineweb-Edu-Chinese-V2.1 是一个面向中文教育领域的大规模文本生成数据集。它包含按质量评分分档整理的内容,评分范围从 2 到 5,其中 4-5 分为高质量教育文本(约 70GB,460 亿 token),3-4 分为较适用的内容(约 800GB,5300 亿 token),2-3 分则为潜在可用但质量有限的数据(约 1.4TB,9300 亿 token)。数据集以文件夹形式组织,便于用户根据训练时间和计算资源灵活选择不同质量档位的数据,适用于各类语言模型的训练与微调。
这是一个用于机器人操作学习的数据集,记录了双臂协作完成“篮子放置与桃子放入”任务的场景。数据集包含 721 个回合、约 30 万帧视频和图像数据,帧率 30 FPS,总大小 3.6GB,格式与 LeRobot 兼容。机器人型号为 Realman RMC-AIDAL,末端为二指夹爪,操作场景涵盖家庭和厨房环境,原子动作包括抓取、拾取和放置。任务涉及左右夹爪配合,将篮子摆正后把桃子放入篮中,共包含 5 个主要任务和 28 个子任务,数据标注了中英文描述。
这个数据集记录了机器人执行“取包子、放入蒸笼并盖盖”这一完整任务的操作过程,包含约1000个片段、近100万帧画面和18.2GB的数据。机器人采用两指夹爪,在家庭场景中完成抓取、放置等原子动作。数据配有3个视角的同步视频,并提供子任务分割、场景描述、末端执行器方向/速度/加速度以及夹爪开合状态等丰富的标注信息,支持机器人学习与模仿研究。
这是一个用于机器人操作的数据集,包含将篮子堆叠的任务。数据由Realman RMC-AIDA-L机器人使用两指夹爪采集,共484个演示片段,总帧数278342(30FPS),涵盖2个主要任务(将棕色篮子放在黄色篮子上,以及将黄色篮子放在棕色篮子上)和15个细分子任务。数据集提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器方向/速度/加速度、夹爪状态与开度,以及模拟空间中的6D位姿等。数据格式兼容LeRobot,支持中英文,适用于模仿学习、机器人操作等研究。
该数据集包含机器人搅拌咖啡的精细操作任务,使用Realman RMC-AIDAL机械臂与两指夹爪,在家庭、办公室和咖啡馆场景中执行抓取、拿取、放置、移动、搅拌等基础动作。数据集共收录767个演示片段、555807帧图像,涵盖8个主要任务(如移动杯子、拿起勺子、搅拌三次并放回)和16个子任务,帧率为30fps,总大小3.6GB。所有数据以兼容LeRobot的扩展格式存储,并包含3个不同相机视角的录制。
这个数据集聚焦于机器人操作任务,使用乐聚机器人(leju_robot)搭配五指灵巧手,在家庭场景中执行从柜中取零件并放置到桌上的操作。数据包含492个完整演示片段,总帧数约73.9万帧,覆盖抓取、放置、拾取等原子动作,并提供3个视角的同步视频。除了动作和状态记录,还附带细粒度子任务分割、场景描述、末端执行器运动方向与速度加速度分类、夹爪开合状态等丰富标注,适合用于模仿学习、动作分割和机器人操控研究。
这是一个用于机器人操作的数据集,基于LeRobot扩展格式,包含688个演示片段,共167,196帧,涵盖15个不同任务。机器人使用五指手爪在家庭场景中执行抓取、放置等原子动作,具体任务包括拿起钢架、真空纸、饮料瓶等物品并放置到桌上或指定位置。数据集以30帧每秒录制,总大小约5.8GB,适用于机器人学习与模仿研究。
这是一个机器人操作数据集,专注于“机械臂拾取电池”这一单一任务。数据集包含387个完整演示,总计约185,469帧,覆盖工厂场景,机器人类型为ruantong_a2d,末端执行器为两指夹爪。数据采集了8个摄像头视角,并提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器运动方向/速度/加速度、夹爪开合状态等。数据格式兼容LeRobot,包含视频、状态、动作和元数据文件,总大小约95.3GB,适用于机器人模仿学习等研究。
Fineweb-Edu-Chinese-V2.2
已完整同步
Chinese Fineweb-Edu 数据集 V2.2 是一个面向中文教育领域的高质量数据集,覆盖从预训练到监督微调(SFT)的完整流程。该版本基于 DeepSeek V3.2 模型,从顶尖质量语料中提取了 143 万条高质量问答对,专为后训练阶段设计。数据集包含 SFT 问答、SFT 上下文和预训练等多种配置,旨在解决中文开源社区中优质教育语料稀缺的问题,助力提升模型在教育场景下的表现。
这个数据集专注于机器人操作任务,包含507个片段、约21万帧图像和92.8GB的数据,全部以LeRobot兼容格式存储。场景设定在工厂环境中,机器人(ruantong_a2d型号,配备二指夹爪)执行抓取、放置和拾取等原子动作,主要任务是将工具放入盒子。数据由8个摄像头视角录制,并提供了丰富的标注,包括子任务分段、场景描述、末端执行器运动方向/速度/加速度、夹爪开合状态以及仿真空间中的6D位姿信息。数据集采用Apache-2.0许可协议,适合用于机器人模仿学习、动作规划等研究。
这是一个机器人操作数据集,包含工厂场景中450个episode的抓取与放置任务,机器人型号为ruantong_a2d,配备两指夹爪。数据集涵盖抓取、拾取和放置三种原子动作,主要任务为同时抓取鼠标和电源线并放入盒子。共包含8个摄像头视角,提供子任务分割、场景描述、末端执行器方向/速度/加速度以及夹爪开合状态等丰富注释,格式兼容LeRobot,总大小约86GB。
本数据集是AgiBot-g1_left_capture_part,专注于机器人抓取任务。数据使用ruantong_a2d型机器人,配备两指夹爪,在工厂场景中执行“单手抓取零件并放入黑色容器”的操作,包含3个子任务。数据集共464个episodes,约17.5万帧,帧率30FPS,大小97.3GB,提供8个相机视角。同时带有丰富的注释信息,包括子任务分割、场景描述、末端执行器方向/速度/加速度、夹爪开合模式与活动状态等,适用于多种机器人学习方法。
AgiBot g1 box storage cardboard box c 是机器人操作演示数据,聚焦将纸箱等物体进行收纳和放置的操作任务,包含视频、轨迹和元数据。
Split_aloha_stack_baskets 是一个机器人操作数据集,基于 LeRobot 扩展格式。它使用 Agilex Cobot Decoupled Magic 机器人平台,配备两指夹爪。数据在家庭和厨房场景中采集,包含抓取、拾取和放置三种原子动作。主要任务是将黑色和棕色篮子按顺序叠放,共计 1066 个 episode、约 47 万帧,总大小 17.5 GB。数据集还提供了 3 个摄像头视角,并标注了细粒度子任务(如“用左夹爪抓取浅色篮子”、“将深色篮子放在浅色篮子之上”等),以及场景分类、末端执行器方向与速度等丰富注释,适用于多种机器人学习研究。
该数据集专注于机器人倒水操作,包含896个完整演示片段,总帧数超过130万。机器人使用两指夹爪,在家庭场景中执行抓取、放置和拾取等原子动作。任务涵盖拿起不同品牌的纸杯和矿泉水瓶,将水倒入杯中并放回原位,共包含8个主要任务和42个详细子任务。数据集兼容LeRobot格式,总大小约13.8GB,适合用于机器人模仿学习研究。
该数据集是一个面向机器人操作的技能数据集合,专注于倒饮料任务。机器人采用六轴协作臂搭配两指夹爪,在家庭场景中执行抓取、拾取、放置和倾倒等原子动作。数据集包含61个具体任务,涉及将橙汁、红酒、雪碧等液体以不同比例倒入黑色马克杯、纸杯和透明杯中,总计1613条演示轨迹,约86万帧画面,视频与动作数据均已同步录制,格式兼容LeRobot框架。
这个数据集专注于桌面整理场景的机器人操作任务,包含1660个完整的操作片段,总帧数超过260万。数据以30帧/秒的速度录制,涵盖抓取、捡拾、放置等基本动作,任务涉及将橘子、纸团、瓶子、文具等物品放入指定容器或笔筒中。数据集采用与LeRobot兼容的格式,提供中英文标注,适合用于机器人学习与操作技能训练。
这个数据集是一个面向桌面整理任务的机器人操作数据集,采用与 LeRobot 兼容的扩展格式。它涵盖了家庭和办公室两种典型场景,包含抓取、捡拾和放置三种原子动作,共收集了 1070 个演示片段,总帧数超过 200 万,帧率为 30fps,数据量约 32.3GB。数据集内包含 6 个主要任务(如将香蕉放到盘子里、把废纸丢进篮子、将水杯直立摆放在盘子旁边等),并进一步细分为 108 个子任务。文本描述同时支持中英文,便于不同语言背景的研究者使用。
这是一个机器人操作数据集,专注于使用两指夹爪执行拉链拉开与拉合动作。数据集包含1868个演示片段、超过83万帧图像,涵盖6个主要任务和14个细分子任务,均在家庭场景中采集。每个片段提供3个相机视角,并包含丰富的标注信息,如子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等,适合用于机器人模仿学习与操作技能研究。