数据集

242 个数据集
Fineweb-Edu-Chinese-V2.2 已完整同步
Chinese Fineweb-Edu 数据集 V2.2 是一个面向中文教育领域的高质量数据集,覆盖从预训练到监督微调(SFT)的完整流程。该版本基于 DeepSeek V3.2 模型,从顶尖质量语料中提取了 143 万条高质量问答对,专为后训练阶段设计。数据集包含 SFT 问答、SFT 上下文和预训练等多种配置,旨在解决中文开源社区中优质教育语料稀缺的问题,助力提升模型在教育场景下的表现。
GITATTRIBUTESMDPDF Apache License 2.0 207 KiB 3 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
AgiBot-g1_storage_item_e 可在线预览 已完整同步
这个数据集专注于机器人操作任务,包含507个片段、约21万帧图像和92.8GB的数据,全部以LeRobot兼容格式存储。场景设定在工厂环境中,机器人(ruantong_a2d型号,配备二指夹爪)执行抓取、放置和拾取等原子动作,主要任务是将工具放入盒子。数据由8个摄像头视角录制,并提供了丰富的标注,包括子任务分段、场景描述、末端执行器运动方向/速度/加速度、夹爪开合状态以及仿真空间中的6D位姿信息。数据集采用Apache-2.0许可协议,适合用于机器人模仿学习、动作规划等研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 93 GiB 4576 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
AgiBot-g1_storage_item_d 可在线预览 已完整同步
这是一个机器人操作数据集,包含工厂场景中450个episode的抓取与放置任务,机器人型号为ruantong_a2d,配备两指夹爪。数据集涵盖抓取、拾取和放置三种原子动作,主要任务为同时抓取鼠标和电源线并放入盒子。共包含8个摄像头视角,提供子任务分割、场景描述、末端执行器方向/速度/加速度以及夹爪开合状态等丰富注释,格式兼容LeRobot,总大小约86GB。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 86 GiB 4063 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
AgiBot-g1_left_capture_part 可在线预览 已完整同步
本数据集是AgiBot-g1_left_capture_part,专注于机器人抓取任务。数据使用ruantong_a2d型机器人,配备两指夹爪,在工厂场景中执行“单手抓取零件并放入黑色容器”的操作,包含3个子任务。数据集共464个episodes,约17.5万帧,帧率30FPS,大小97.3GB,提供8个相机视角。同时带有丰富的注释信息,包括子任务分割、场景描述、末端执行器方向/速度/加速度、夹爪开合模式与活动状态等,适用于多种机器人学习方法。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 97 GiB 4189 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
AgiBot-g1_box_storage_cardboard_box_c 可在线预览 已完整同步
AgiBot g1 box storage cardboard box c 是机器人操作演示数据,聚焦将纸箱等物体进行收纳和放置的操作任务,包含视频、轨迹和元数据。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 109 GiB 4297 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
Split_aloha_stack_baskets 可在线预览 已完整同步
Split_aloha_stack_baskets 是一个机器人操作数据集,基于 LeRobot 扩展格式。它使用 Agilex Cobot Decoupled Magic 机器人平台,配备两指夹爪。数据在家庭和厨房场景中采集,包含抓取、拾取和放置三种原子动作。主要任务是将黑色和棕色篮子按顺序叠放,共计 1066 个 episode、约 47 万帧,总大小 17.5 GB。数据集还提供了 3 个摄像头视角,并标注了细粒度子任务(如“用左夹爪抓取浅色篮子”、“将深色篮子放在浅色篮子之上”等),以及场景分类、末端执行器方向与速度等丰富注释,适用于多种机器人学习研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 14 GiB 3677 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
Cobot_Magic_pour_water_a 可在线预览 已完整同步
该数据集专注于机器人倒水操作,包含896个完整演示片段,总帧数超过130万。机器人使用两指夹爪,在家庭场景中执行抓取、放置和拾取等原子动作。任务涵盖拿起不同品牌的纸杯和矿泉水瓶,将水倒入杯中并放回原位,共包含8个主要任务和42个详细子任务。数据集兼容LeRobot格式,总大小约13.8GB,适合用于机器人模仿学习研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 14 GiB 3577 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
本数据集收录了高校录取分数和位次信息,字段齐全、数据规模充足,适合用于高校招生与录取相关分析。使用时需注意按派生或索引口径进行处理。数据提供 JSON、CSV 等多种格式。
CSVGITIGNOREJSJSONMDPY 104 MiB 2712 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
Overture Maps 地理地点数据集 可在线预览 已完整同步
Overture Maps Places 是地点与兴趣点地理数据快照,使用 Parquet 保存地点名称、类别、位置及相关属性,适合地理分析和地点检索。
PARQUET Open Database License (ODbL) v1.0 268 GiB 529 个文件 WeHub 同步于 2026-08-07 10:25:47 +00:00
OpenAlex 学术数据快照 已完整同步
OpenAlex 学术数据快照是压缩的学术元数据资源,覆盖论文、作者、机构、来源、主题及引用关系等信息,适合文献计量与学术检索研究。
GZ CC0 1.0 Universal 694 GiB 5202 个文件 WeHub 同步于 2026-08-07 10:25:47 +00:00
UNO-Bench 可在线预览 已完整同步
UNO-Bench是一个统一的全模态模型基准测试,旨在评估单模态与全模态(视觉、音频、语言)的理解能力。它包含44种任务类型和5种模态组合,共1250个人工标注的全模态样本和2480个增强的单模态样本。该数据集特别适合中文真实场景,支持多选和创新的多步开放式问题,并借助通用评分模型实现高效自动评估。通过该基准,可以揭示全模态能力在弱模型上的瓶颈效应与强模型上的协同促进规律。
GITATTRIBUTESJPEGJPGMDMP3MP4PARQUETPDFPNGWAV MIT License 10 GiB 5735 个文件 WeHub 同步于 2026-08-07 02:56:56 +00:00
Cobot_Magic_pour_drink 可在线预览 已完整同步
该数据集是一个面向机器人操作的技能数据集合,专注于倒饮料任务。机器人采用六轴协作臂搭配两指夹爪,在家庭场景中执行抓取、拾取、放置和倾倒等原子动作。数据集包含61个具体任务,涉及将橙汁、红酒、雪碧等液体以不同比例倒入黑色马克杯、纸杯和透明杯中,总计1613条演示轨迹,约86万帧画面,视频与动作数据均已同步录制,格式兼容LeRobot框架。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 13 GiB 6465 个文件 WeHub 同步于 2026-08-07 02:55:51 +00:00
RMC-AIDA-L_desktop_organization 可在线预览 已完整同步
这个数据集专注于桌面整理场景的机器人操作任务,包含1660个完整的操作片段,总帧数超过260万。数据以30帧/秒的速度录制,涵盖抓取、捡拾、放置等基本动作,任务涉及将橘子、纸团、瓶子、文具等物品放入指定容器或笔筒中。数据集采用与LeRobot兼容的格式,提供中英文标注,适合用于机器人学习与操作技能训练。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 38 GiB 6504 个文件 WeHub 同步于 2026-08-07 02:55:47 +00:00
Cobot_Magic_desktop_organization 可在线预览 已完整同步
这个数据集是一个面向桌面整理任务的机器人操作数据集,采用与 LeRobot 兼容的扩展格式。它涵盖了家庭和办公室两种典型场景,包含抓取、捡拾和放置三种原子动作,共收集了 1070 个演示片段,总帧数超过 200 万,帧率为 30fps,数据量约 32.3GB。数据集内包含 6 个主要任务(如将香蕉放到盘子里、把废纸丢进篮子、将水杯直立摆放在盘子旁边等),并进一步细分为 108 个子任务。文本描述同时支持中英文,便于不同语言背景的研究者使用。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 31 GiB 5165 个文件 WeHub 同步于 2026-08-07 02:55:38 +00:00
Cobot_Magic_pull_zipper 可在线预览 已完整同步
这是一个机器人操作数据集,专注于使用两指夹爪执行拉链拉开与拉合动作。数据集包含1868个演示片段、超过83万帧图像,涵盖6个主要任务和14个细分子任务,均在家庭场景中采集。每个片段提供3个相机视角,并包含丰富的标注信息,如子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等,适合用于机器人模仿学习与操作技能研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 11 GiB 7486 个文件 WeHub 同步于 2026-08-07 02:55:34 +00:00
AI-MO/NuminaMath-CoT 可在线预览 已完整同步
NuminaMath-CoT 是数学推理训练与评测数据集,包含约 86 万道数学题及对应解答,字段包括题目、解答、来源和多轮消息,并提供训练集与测试集。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.1 GiB 8 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个从ShareGPT对话中精选的英文对话数据集,经过严格清洗得到约5.3万条高质量样本。清洗过程移除了非英语内容、大量重复字符,并过滤掉了包含常见“AI道德说教”短语的对话,旨在减少模型训练中的安全拒绝倾向。数据集提供两个版本,其中一个额外去掉了含有“I'm sorry, but”的实例,使用者可根据需求选择。适合用于训练开放、少限制的对话模型。
GITATTRIBUTESIPYNBJSONMDPYWHL Apache License 2.0 4.0 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个包含约9万张合成数字签名图片的数据集,涵盖了30种手写与签名风格的字体。每种字体提供3000张签名样本,图片格式统一为PNG。数据集可用于训练和评估数字签名检测、字体识别以及文档验证等计算机视觉任务,特别适用于识别那些通过键盘输入、模仿真实手写签名的“打字数字签名”。
GITATTRIBUTESMDPNG MIT License 142 MiB 32845 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Tongyi-MAI/Z-Image-Turbo 已完整同步
Z-Image-Turbo 是一个高效的图像生成模型,基于单流扩散 Transformer 架构,拥有 6B 参数。它通过蒸馏技术实现了仅需 8 步评估即可生成高质量图像,推理延迟可低至亚秒级,并能在 16G 显存的消费级设备上运行。该模型擅长生成逼真的图像,支持中英文双语文本渲染,且具备良好的指令跟随能力。此外,该系列还包括 Z-Image 基础模型、支持生成与编辑的 Z-Image-Omni-Base 以及专注于图像编辑的 Z-Image-Edit 等变体,覆盖了从高质量生成到精细编辑的多种场景。
GITATTRIBUTESJPGJSONMDPDFPNGSAFETENSORSTXTWEBP Apache License 2.0 31 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cais/mmlu 可在线预览 已完整同步
MMLU 是英文多任务语言理解评测集,覆盖抽象代数、法律、医学、计算机科学等多个学科,以多项选择题评估模型的知识与推理能力。
GITATTRIBUTESJSONMDPARQUETPYTAR MIT License 258 MiB 181 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00