数据集

107 个数据集
已选筛选: JSON apache-2.0 清除所有筛选
Qwen3-30B-A3B-Thinking-2507 是一个基于 Transformer 的因果语言模型,采用混合专家(MoE)架构,总参数量为 30.5B,每次推理仅激活 3.3B 参数。它原生支持高达 262K 的上下文长度,在逻辑推理、数学、科学、编程等复杂推理任务上表现显著提升,同时指令遵循、工具使用、文本生成等通用能力也有明显增强。该模型默认开启深度思考模式,特别适合处理高复杂度的推理场景。
GITATTRIBUTESJSONMDSAFETENSORSTXT Apache License 2.0 57 GiB 27 个文件 WeHub 同步于 2026-08-20 02:03:47 +00:00
中文语音识别Aishell-1学术数据集训练集 可在线预览 已完整同步
AISHELL-1 trainsets 是中文语音识别训练资源,面向普通话语音转写和 ASR 模型训练,包含训练集相关索引、元数据或说明文件。
CSVJSONMD Apache License 2.0 17 MiB 6 个文件 WeHub 同步于 2026-08-20 02:03:47 +00:00
BERT base uncased是一个基于Transformer架构的预训练语言模型,通过掩码语言建模和下一句预测两个自监督任务,在大规模英文语料上学习到了丰富的语言表示。该模型不区分大小写,拥有约1.1亿参数,适用于多种自然语言处理下游任务的微调,如文本分类、问答和命名实体识别等。
BINGITATTRIBUTESH5JSONMDMLMODELMSGPACKONNXOTSAFETENSORSTXT Apache License 2.0 3.2 GiB 16 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
这是一个中文句子嵌入模型,基于CoSENT方法训练,能够将句子映射为768维的稠密向量,适用于语义相似度计算、文本匹配和语义搜索等任务。模型在多个中文语义评测数据集上取得了较好的表现。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
中文诗词数据集 可在线预览 已完整同步
这是一个中文诗词数据集,收录了从中国古代各朝代的诗词作品,可用于训练诗词续写模型。数据集包含约38.9万条训练样本和1710条测试样本,每条记录以“text1”字段存储一段完整的诗词内容。数据格式支持CSV、JSON和Markdown,便于不同场景下的使用。
CSVJSONMD Apache License 2.0 42 MiB 5 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
中文Text2SQL数据集 可在线预览 已完整同步
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
CSVJSONMDPNG Apache License 2.0 1.3 MiB 6 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
Qwen/Qwen3.5-4B 已完整同步
Qwen3.5-4B 是一个拥有 40 亿参数的多模态大语言模型,能够同时处理图像和文本输入。它采用高效的混合架构,结合了 Gated Delta Networks 与稀疏混合专家,在保持低延迟的同时实现高吞吐推理。该模型原生支持 26 万 token 的上下文长度,并可扩展至百万级,还覆盖了 201 种语言,具备广泛的语言和文化理解能力。通过大规模强化学习训练,它在推理、代码、代理任务和视觉理解等方面表现出色。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 8.7 GiB 14 个文件 WeHub 同步于 2026-08-19 14:32:57 +00:00
这是一个中文数据集,包含约11万条从DeepSeek-R1蒸馏得到的指令-回答对,已整合为可直接用于监督微调(SFT)的格式。数据涵盖数学、考试、STEM及通用领域(如逻辑推理、小红书、知乎等),并保留了模型打分结果(如正确性、无害性、有用性),便于后续筛选。请注意,数据由模型生成,未经严格验证,使用时需自行甄别。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 647 MiB 4 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
自我认知微调数据集 可在线预览 已完整同步
这是一个用于自我认知微调的数据集,包含108条中英文对话样本。每条样本都通过可替换的占位符(如模型名称和作者)设计,方便用户自定义和生成专属大模型的自我认知数据。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 29 KiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
这是一个中文句子嵌入模型,能将句子映射到768维的稠密向量空间,适用于文本匹配、语义搜索等任务。它基于MacBERT架构,使用中文语义相似度数据训练,在多个中文文本匹配基准上均表现出不错的性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXTXML Apache License 2.0 1.8 GiB 22 个文件 WeHub 同步于 2026-08-19 13:05:10 +00:00
这是一个多语言句子嵌入模型,能将句子和段落转换为384维的稠密向量,适用于文本聚类、语义搜索和句子相似度计算等任务。模型支持包括中文在内的50多种语言,基于MiniLM架构,采用均值池化方式生成句子级别的向量表示,输出可直接用于下游应用。
BINGITATTRIBUTESH5JSONMDMODELONNXSAFETENSORSXML Apache License 2.0 4.3 GiB 28 个文件 WeHub 同步于 2026-08-19 12:47:07 +00:00
Cobot_Magic_food_packaging 可在线预览 已完整同步
这是一个用于机器人食品包装任务的协作机器人数据集,基于LeRobot扩展格式。数据由配备两指夹爪的AgileX Cobot机器人采集,在厨房场景中执行抓取、拉、放置、拾取等原子动作。数据集包含798个演示片段,总帧数约147万,涵盖两个主要任务:将午餐盒、黄瓜和梨放入小包装袋,以及将午餐盒、香蕉和面包放入大包装袋,并进一步细分为49个子任务。数据以视频、parquet和JSONL等格式提供,支持中英文描述,适用于机器人模仿学习等研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 25 GiB 3382 个文件 WeHub 同步于 2026-08-12 09:25:17 +00:00
RMC-AIDA-L_place_test_tube 可在线预览 已完整同步
这是一个面向机器人操作任务的精细动作数据集,包含648个完整演示片段,总帧数约36.6万,每秒30帧,数据量约4GB。数据集以试管放置为核心任务,涵盖抓取、放置、传递、移动等多种原子动作,并细分为12个子任务。场景覆盖学校与医院两类环境,配备3个相机视角,且提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的方向、速度、加速度以及夹爪状态等,适合用于机器人模仿学习、动作规划等研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 4.0 GiB 2606 个文件 WeHub 同步于 2026-08-12 09:15:17 +00:00
RMC-AIDA-L_pour_rice 可在线预览 已完整同步
这是一个基于 LeRobot 扩展格式的机器人操作数据集,包含 714 个片段(约 41 万帧),记录了在厨房和餐厅场景中,机器人使用两指夹爪完成“倒米”任务的操作过程。任务要求机器人用一只手将碗放至桌子中央,另一只手将米杯中的米倒入碗中,涉及抓取、拾取、放置和倒米等原子动作。数据集包含 3 个视角的视频,并提供了丰富的标注,如子任务分割、场景描述、末端执行器的运动方向/速度/加速度,以及夹爪开合状态等,便于用于机器人学习研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 2.9 GiB 2869 个文件 WeHub 同步于 2026-08-12 08:55:17 +00:00
Split_aloha_pour_rice 可在线预览 已完整同步
这是一个用于机器人操作的数据集,聚焦于“倒米”任务,包含740个演示片段,共计约50万帧,以30帧/秒的速率记录。机器人采用双臂构型,配备两个二指夹爪,在居家和厨房场景中执行抓取、放置、倾倒等原子动作。数据集提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的运动方向与速度、夹爪开合状态等,还包含3个相机视角的同步视频,可用于模仿学习、行为克隆等研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 4.9 GiB 2973 个文件 WeHub 同步于 2026-08-12 08:55:17 +00:00
RMC-AIDA-L_pour_tea 可在线预览 已完整同步
该数据集是一个面向机器人操作任务的倒茶数据集,使用兼容LeRobot的扩展格式。机器人类型为 realman_rmc_aidal,配备两指夹爪,在家庭和餐厅场景中采集。数据包含抓取、放置、拾取和倒水四种原子动作,总共有790个演示片段、约55万帧,以及3个视角的同步视频。每个任务都提供了细粒度的子任务分割、场景描述、末端执行器运动方向与速度标注、夹爪状态等丰富注释,适合用于机器人模仿学习与操作技能研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 3.9 GiB 3123 个文件 WeHub 同步于 2026-08-12 08:45:17 +00:00
RMC-AIDA-L_fold_shorts 可在线预览 已完整同步
该数据集是一个用于机器人操作任务的数据集,专注于将短裤进行折叠。数据由Realman RMC-AIDA-L机器人配合两指夹爪采集,在家庭场景中完成。数据集包含抓取、拾取、折叠、放置等基本原子动作,共计866个演示片段,约73万帧,覆盖4个主要任务和29个细分子任务。数据格式兼容LeRobot,并提供中英文标注。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 9.5 GiB 3477 个文件 WeHub 同步于 2026-08-12 08:45:17 +00:00
RMC-AIDA-L_place_the_fruits_repeatedly 可在线预览 已完整同步
该数据集是一个面向机器人操作的仿真数据集,基于LeRobot格式扩展,兼容LeRobot工具链。数据使用RealMan RMC-AIDA-L机器人,配备两指夹爪,在厨房场景中执行反复将水果放入碗中再倒出的操作任务。具体任务包括将面包、蛋黄酥、橙子、桃子分别放入蓝色或粉色碗中并重复倒出,共包含8个主要任务和17个细分子任务。数据集共481个演示片段,约54万帧,帧率30fps,总大小3.7GB,并配有3个相机视角的RGB视频。标注信息丰富,包括子任务分割、场景描述、末端执行器的运动方向、速度和加速度分类等,支持多种机器人学习方法。数据集使用Apache-2.0许可证,语言为英文和中文。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 3.7 GiB 1938 个文件 WeHub 同步于 2026-08-12 08:35:17 +00:00
RMC-AIDA-L_basket_storage_long_bread 可在线预览 已完整同步
这个数据集包含机器人操作演示,使用Realman RM-C AIDAL机械臂与两指夹爪,在家庭和厨房场景中执行抓取、拾取和放置等动作。具体任务涉及用左右夹爪将篮子移至合适位置,再将长条面包放入篮中。数据集共753个回合,约3.9GB,采用LeRobot兼容格式。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 3.9 GiB 3025 个文件 WeHub 同步于 2026-08-12 08:25:17 +00:00
RMC-AIDA-L_glasses_storage 可在线预览 已完整同步
该数据集是一个基于LeRobot格式的机器人操作数据集,专注于将眼镜放入眼镜盒的任务。数据包含990个演示片段,共约86万帧,覆盖4种具体任务(如将黑色眼镜放入黑色或绿色眼镜盒)。机器人型号为realman_rmc_aidal,末端采用两指夹爪,场景为家庭环境。原子动作包括抓取、拾取、折叠、关闭和放置等。数据集提供3个相机视角,并带有丰富的标注,包括子任务分割、场景描述以及末端执行器的方向、速度、加速度等信息。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 8.6 GiB 3974 个文件 WeHub 同步于 2026-08-12 08:15:17 +00:00