数据集
42 个数据集
热门分类:
这是一个用于机器人操作学习的数据集,记录了双臂协作完成“篮子放置与桃子放入”任务的场景。数据集包含 721 个回合、约 30 万帧视频和图像数据,帧率 30 FPS,总大小 3.6GB,格式与 LeRobot 兼容。机器人型号为 Realman RMC-AIDAL,末端为二指夹爪,操作场景涵盖家庭和厨房环境,原子动作包括抓取、拾取和放置。任务涉及左右夹爪配合,将篮子摆正后把桃子放入篮中,共包含 5 个主要任务和 28 个子任务,数据标注了中英文描述。
这个数据集记录了机器人执行“取包子、放入蒸笼并盖盖”这一完整任务的操作过程,包含约1000个片段、近100万帧画面和18.2GB的数据。机器人采用两指夹爪,在家庭场景中完成抓取、放置等原子动作。数据配有3个视角的同步视频,并提供子任务分割、场景描述、末端执行器方向/速度/加速度以及夹爪开合状态等丰富的标注信息,支持机器人学习与模仿研究。
这是一个用于机器人操作的数据集,包含将篮子堆叠的任务。数据由Realman RMC-AIDA-L机器人使用两指夹爪采集,共484个演示片段,总帧数278342(30FPS),涵盖2个主要任务(将棕色篮子放在黄色篮子上,以及将黄色篮子放在棕色篮子上)和15个细分子任务。数据集提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器方向/速度/加速度、夹爪状态与开度,以及模拟空间中的6D位姿等。数据格式兼容LeRobot,支持中英文,适用于模仿学习、机器人操作等研究。
该数据集包含机器人搅拌咖啡的精细操作任务,使用Realman RMC-AIDAL机械臂与两指夹爪,在家庭、办公室和咖啡馆场景中执行抓取、拿取、放置、移动、搅拌等基础动作。数据集共收录767个演示片段、555807帧图像,涵盖8个主要任务(如移动杯子、拿起勺子、搅拌三次并放回)和16个子任务,帧率为30fps,总大小3.6GB。所有数据以兼容LeRobot的扩展格式存储,并包含3个不同相机视角的录制。
这个数据集聚焦于机器人操作任务,使用乐聚机器人(leju_robot)搭配五指灵巧手,在家庭场景中执行从柜中取零件并放置到桌上的操作。数据包含492个完整演示片段,总帧数约73.9万帧,覆盖抓取、放置、拾取等原子动作,并提供3个视角的同步视频。除了动作和状态记录,还附带细粒度子任务分割、场景描述、末端执行器运动方向与速度加速度分类、夹爪开合状态等丰富标注,适合用于模仿学习、动作分割和机器人操控研究。
这是一个用于机器人操作的数据集,基于LeRobot扩展格式,包含688个演示片段,共167,196帧,涵盖15个不同任务。机器人使用五指手爪在家庭场景中执行抓取、放置等原子动作,具体任务包括拿起钢架、真空纸、饮料瓶等物品并放置到桌上或指定位置。数据集以30帧每秒录制,总大小约5.8GB,适用于机器人学习与模仿研究。
这是一个机器人操作数据集,专注于“机械臂拾取电池”这一单一任务。数据集包含387个完整演示,总计约185,469帧,覆盖工厂场景,机器人类型为ruantong_a2d,末端执行器为两指夹爪。数据采集了8个摄像头视角,并提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器运动方向/速度/加速度、夹爪开合状态等。数据格式兼容LeRobot,包含视频、状态、动作和元数据文件,总大小约95.3GB,适用于机器人模仿学习等研究。
这个数据集专注于机器人操作任务,包含507个片段、约21万帧图像和92.8GB的数据,全部以LeRobot兼容格式存储。场景设定在工厂环境中,机器人(ruantong_a2d型号,配备二指夹爪)执行抓取、放置和拾取等原子动作,主要任务是将工具放入盒子。数据由8个摄像头视角录制,并提供了丰富的标注,包括子任务分段、场景描述、末端执行器运动方向/速度/加速度、夹爪开合状态以及仿真空间中的6D位姿信息。数据集采用Apache-2.0许可协议,适合用于机器人模仿学习、动作规划等研究。
这是一个机器人操作数据集,包含工厂场景中450个episode的抓取与放置任务,机器人型号为ruantong_a2d,配备两指夹爪。数据集涵盖抓取、拾取和放置三种原子动作,主要任务为同时抓取鼠标和电源线并放入盒子。共包含8个摄像头视角,提供子任务分割、场景描述、末端执行器方向/速度/加速度以及夹爪开合状态等丰富注释,格式兼容LeRobot,总大小约86GB。
本数据集是AgiBot-g1_left_capture_part,专注于机器人抓取任务。数据使用ruantong_a2d型机器人,配备两指夹爪,在工厂场景中执行“单手抓取零件并放入黑色容器”的操作,包含3个子任务。数据集共464个episodes,约17.5万帧,帧率30FPS,大小97.3GB,提供8个相机视角。同时带有丰富的注释信息,包括子任务分割、场景描述、末端执行器方向/速度/加速度、夹爪开合模式与活动状态等,适用于多种机器人学习方法。
AgiBot g1 box storage cardboard box c 是机器人操作演示数据,聚焦将纸箱等物体进行收纳和放置的操作任务,包含视频、轨迹和元数据。
Split_aloha_stack_baskets 是一个机器人操作数据集,基于 LeRobot 扩展格式。它使用 Agilex Cobot Decoupled Magic 机器人平台,配备两指夹爪。数据在家庭和厨房场景中采集,包含抓取、拾取和放置三种原子动作。主要任务是将黑色和棕色篮子按顺序叠放,共计 1066 个 episode、约 47 万帧,总大小 17.5 GB。数据集还提供了 3 个摄像头视角,并标注了细粒度子任务(如“用左夹爪抓取浅色篮子”、“将深色篮子放在浅色篮子之上”等),以及场景分类、末端执行器方向与速度等丰富注释,适用于多种机器人学习研究。
该数据集专注于机器人倒水操作,包含896个完整演示片段,总帧数超过130万。机器人使用两指夹爪,在家庭场景中执行抓取、放置和拾取等原子动作。任务涵盖拿起不同品牌的纸杯和矿泉水瓶,将水倒入杯中并放回原位,共包含8个主要任务和42个详细子任务。数据集兼容LeRobot格式,总大小约13.8GB,适合用于机器人模仿学习研究。
UNO-Bench是一个统一的全模态模型基准测试,旨在评估单模态与全模态(视觉、音频、语言)的理解能力。它包含44种任务类型和5种模态组合,共1250个人工标注的全模态样本和2480个增强的单模态样本。该数据集特别适合中文真实场景,支持多选和创新的多步开放式问题,并借助通用评分模型实现高效自动评估。通过该基准,可以揭示全模态能力在弱模型上的瓶颈效应与强模型上的协同促进规律。
该数据集是一个面向机器人操作的技能数据集合,专注于倒饮料任务。机器人采用六轴协作臂搭配两指夹爪,在家庭场景中执行抓取、拾取、放置和倾倒等原子动作。数据集包含61个具体任务,涉及将橙汁、红酒、雪碧等液体以不同比例倒入黑色马克杯、纸杯和透明杯中,总计1613条演示轨迹,约86万帧画面,视频与动作数据均已同步录制,格式兼容LeRobot框架。
这个数据集专注于桌面整理场景的机器人操作任务,包含1660个完整的操作片段,总帧数超过260万。数据以30帧/秒的速度录制,涵盖抓取、捡拾、放置等基本动作,任务涉及将橘子、纸团、瓶子、文具等物品放入指定容器或笔筒中。数据集采用与LeRobot兼容的格式,提供中英文标注,适合用于机器人学习与操作技能训练。
这个数据集是一个面向桌面整理任务的机器人操作数据集,采用与 LeRobot 兼容的扩展格式。它涵盖了家庭和办公室两种典型场景,包含抓取、捡拾和放置三种原子动作,共收集了 1070 个演示片段,总帧数超过 200 万,帧率为 30fps,数据量约 32.3GB。数据集内包含 6 个主要任务(如将香蕉放到盘子里、把废纸丢进篮子、将水杯直立摆放在盘子旁边等),并进一步细分为 108 个子任务。文本描述同时支持中英文,便于不同语言背景的研究者使用。
这是一个机器人操作数据集,专注于使用两指夹爪执行拉链拉开与拉合动作。数据集包含1868个演示片段、超过83万帧图像,涵盖6个主要任务和14个细分子任务,均在家庭场景中采集。每个片段提供3个相机视角,并包含丰富的标注信息,如子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等,适合用于机器人模仿学习与操作技能研究。
Wan-AI/Wan2.2-S2V-14B
已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。