数据集
71 个数据集
热门分类:
这个数据集专注于机器人操作任务,包含507个片段、约21万帧图像和92.8GB的数据,全部以LeRobot兼容格式存储。场景设定在工厂环境中,机器人(ruantong_a2d型号,配备二指夹爪)执行抓取、放置和拾取等原子动作,主要任务是将工具放入盒子。数据由8个摄像头视角录制,并提供了丰富的标注,包括子任务分段、场景描述、末端执行器运动方向/速度/加速度、夹爪开合状态以及仿真空间中的6D位姿信息。数据集采用Apache-2.0许可协议,适合用于机器人模仿学习、动作规划等研究。
这是一个机器人操作数据集,包含工厂场景中450个episode的抓取与放置任务,机器人型号为ruantong_a2d,配备两指夹爪。数据集涵盖抓取、拾取和放置三种原子动作,主要任务为同时抓取鼠标和电源线并放入盒子。共包含8个摄像头视角,提供子任务分割、场景描述、末端执行器方向/速度/加速度以及夹爪开合状态等丰富注释,格式兼容LeRobot,总大小约86GB。
本数据集是AgiBot-g1_left_capture_part,专注于机器人抓取任务。数据使用ruantong_a2d型机器人,配备两指夹爪,在工厂场景中执行“单手抓取零件并放入黑色容器”的操作,包含3个子任务。数据集共464个episodes,约17.5万帧,帧率30FPS,大小97.3GB,提供8个相机视角。同时带有丰富的注释信息,包括子任务分割、场景描述、末端执行器方向/速度/加速度、夹爪开合模式与活动状态等,适用于多种机器人学习方法。
AgiBot g1 box storage cardboard box c 是机器人操作演示数据,聚焦将纸箱等物体进行收纳和放置的操作任务,包含视频、轨迹和元数据。
Split_aloha_stack_baskets 是一个机器人操作数据集,基于 LeRobot 扩展格式。它使用 Agilex Cobot Decoupled Magic 机器人平台,配备两指夹爪。数据在家庭和厨房场景中采集,包含抓取、拾取和放置三种原子动作。主要任务是将黑色和棕色篮子按顺序叠放,共计 1066 个 episode、约 47 万帧,总大小 17.5 GB。数据集还提供了 3 个摄像头视角,并标注了细粒度子任务(如“用左夹爪抓取浅色篮子”、“将深色篮子放在浅色篮子之上”等),以及场景分类、末端执行器方向与速度等丰富注释,适用于多种机器人学习研究。
该数据集专注于机器人倒水操作,包含896个完整演示片段,总帧数超过130万。机器人使用两指夹爪,在家庭场景中执行抓取、放置和拾取等原子动作。任务涵盖拿起不同品牌的纸杯和矿泉水瓶,将水倒入杯中并放回原位,共包含8个主要任务和42个详细子任务。数据集兼容LeRobot格式,总大小约13.8GB,适合用于机器人模仿学习研究。
该数据集是一个面向机器人操作的技能数据集合,专注于倒饮料任务。机器人采用六轴协作臂搭配两指夹爪,在家庭场景中执行抓取、拾取、放置和倾倒等原子动作。数据集包含61个具体任务,涉及将橙汁、红酒、雪碧等液体以不同比例倒入黑色马克杯、纸杯和透明杯中,总计1613条演示轨迹,约86万帧画面,视频与动作数据均已同步录制,格式兼容LeRobot框架。
这个数据集专注于桌面整理场景的机器人操作任务,包含1660个完整的操作片段,总帧数超过260万。数据以30帧/秒的速度录制,涵盖抓取、捡拾、放置等基本动作,任务涉及将橘子、纸团、瓶子、文具等物品放入指定容器或笔筒中。数据集采用与LeRobot兼容的格式,提供中英文标注,适合用于机器人学习与操作技能训练。
这个数据集是一个面向桌面整理任务的机器人操作数据集,采用与 LeRobot 兼容的扩展格式。它涵盖了家庭和办公室两种典型场景,包含抓取、捡拾和放置三种原子动作,共收集了 1070 个演示片段,总帧数超过 200 万,帧率为 30fps,数据量约 32.3GB。数据集内包含 6 个主要任务(如将香蕉放到盘子里、把废纸丢进篮子、将水杯直立摆放在盘子旁边等),并进一步细分为 108 个子任务。文本描述同时支持中英文,便于不同语言背景的研究者使用。
这是一个机器人操作数据集,专注于使用两指夹爪执行拉链拉开与拉合动作。数据集包含1868个演示片段、超过83万帧图像,涵盖6个主要任务和14个细分子任务,均在家庭场景中采集。每个片段提供3个相机视角,并包含丰富的标注信息,如子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等,适合用于机器人模仿学习与操作技能研究。
该数据集包含用于文本分类的评分标准(rubrics),覆盖健康、通用和金融三个领域。其中健康与通用领域各有5000条训练提示及对应评分标准,并额外提供1000条提示用于端到端胜率对比;金融领域提供1145条训练提示及评分标准。数据以JSONL格式存储,可用于基于评分标准的强化学习奖励建模。
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
GSM8K-V 是一个纯视觉的多图像数学推理基准,旨在将传统文本数学应用题转化为视觉形式。它包含 1,319 个高质量的多场景问题(共 5,343 张图像),覆盖了从现实场景中提取的数学推理任务。该基准可用于评估视觉语言模型在理解图像、跨图像推理以及解决算术问题方面的能力。评测结果表明,即使是当前最强的模型,在视觉数学推理上也与文本任务存在显著差距,凸显了该领域仍有很大的提升空间。
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。
Robust-R1 是一个面向退化感知推理的视觉问答数据集,基于 A-OKVQA 子集构建,包含 1 万条训练样本和 1 千条验证样本,旨在提升模型在复杂视觉退化场景下的鲁棒理解能力。
EduBench是一个面向教育场景的综合性评估基准数据集,专门用于衡量大语言模型在多样化教学任务中的表现。它覆盖了学生和教师两大视角,共包含十个子任务,如问答、纠错、情感支持、自动出题、评分与教案生成等。数据以JSONL格式提供,每条记录包含任务元信息、输入提示词,以及多个主流大模型的预测结果,便于研究者进行对比分析。
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
LIFEBench是一个专门用于评估大语言模型遵循长度指令能力的综合基准数据集。它包含英文和中文两种语言,覆盖问答、摘要、文本生成等多种任务,长度约束范围从16个单词到8192个单词不等。数据集提供了多个子集(如主集、标签集、精简集和重构集),方便不同场景下的评估。通过分析多个主流模型,该数据集发现大多数模型在短长度指令上表现良好,但超过一定长度后性能急剧下降,揭示了当前大语言模型在长度遵循方面的根本性局限。
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。