数据集
54 个数据集
热门分类:
该数据集是一个面向机器人操作的技能数据集合,专注于倒饮料任务。机器人采用六轴协作臂搭配两指夹爪,在家庭场景中执行抓取、拾取、放置和倾倒等原子动作。数据集包含61个具体任务,涉及将橙汁、红酒、雪碧等液体以不同比例倒入黑色马克杯、纸杯和透明杯中,总计1613条演示轨迹,约86万帧画面,视频与动作数据均已同步录制,格式兼容LeRobot框架。
这个数据集专注于桌面整理场景的机器人操作任务,包含1660个完整的操作片段,总帧数超过260万。数据以30帧/秒的速度录制,涵盖抓取、捡拾、放置等基本动作,任务涉及将橘子、纸团、瓶子、文具等物品放入指定容器或笔筒中。数据集采用与LeRobot兼容的格式,提供中英文标注,适合用于机器人学习与操作技能训练。
这个数据集是一个面向桌面整理任务的机器人操作数据集,采用与 LeRobot 兼容的扩展格式。它涵盖了家庭和办公室两种典型场景,包含抓取、捡拾和放置三种原子动作,共收集了 1070 个演示片段,总帧数超过 200 万,帧率为 30fps,数据量约 32.3GB。数据集内包含 6 个主要任务(如将香蕉放到盘子里、把废纸丢进篮子、将水杯直立摆放在盘子旁边等),并进一步细分为 108 个子任务。文本描述同时支持中英文,便于不同语言背景的研究者使用。
这是一个机器人操作数据集,专注于使用两指夹爪执行拉链拉开与拉合动作。数据集包含1868个演示片段、超过83万帧图像,涵盖6个主要任务和14个细分子任务,均在家庭场景中采集。每个片段提供3个相机视角,并包含丰富的标注信息,如子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等,适合用于机器人模仿学习与操作技能研究。
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。
OpenBuddy/R1-0528-Distill 是一个包含多种格式的数据集,主要采用 JSONL 格式,同时包含 Git 属性文件和 Markdown 文档。其内容涵盖结构化文本、纯文本以及二进制数据,适合用于语言模型的蒸馏训练或相关研究。
Mobile-R1 是一个面向移动端 GUI 代理的中文轨迹数据集,包含从用户指令到完整交互过程的记录。每个样本由应用名称、指令文本、系统提示和一系列操作步骤组成,步骤中保存了对应屏幕截图、模型推理、子任务描述以及具体的执行动作(如点击、滑动、输入、等待等),并标注了屏幕尺寸用于坐标对齐。该数据集可用于训练和评估多模态模型在真实手机界面上的任务理解与操作生成能力。
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
FineFineWeb 是一个大规模英文网页语料库,专注于细粒度领域的文本分类与生成。该数据集覆盖了航空航天、农学、艺术、计算机科学、经济学、健康、法律等数十个领域,总计超过1万亿 token。通过多次迭代处理,它提供了丰富的结构化文本,适用于文本分类、文本生成和文本到文本生成等多种自然语言处理任务。
AgentWorldBench是一个评估语言世界模型能力的综合基准,它基于前沿模型在真实环境中执行任务时的轨迹数据构建而成。该基准覆盖了七个领域:API服务器响应、搜索引擎结果、命令行环境、代码编辑环境、Android UI、浏览器DOM以及桌面操作系统。每个评估样本包含多轮交互历史,要求模型根据之前的动作和观察,预测当前环境观察结果。评价维度包括格式、事实性、一致性、真实性和质量,旨在全面检验世界模型在推理、知识和长上下文理解方面的能力。
这是一个中文数据集,包含约11万条由DeepSeek-R1模型蒸馏得到的指令数据,涵盖数学、考试、STEM以及通用领域(如逻辑推理、社交问答等)。每条数据包含输入、思考过程、输出和评分字段,适用于文本生成、问答等任务的监督微调。数据集采用Apache-2.0许可。