数据集

223 个数据集
已选筛选: MD 清除所有筛选
Cobot_Magic_desktop_organization 可在线预览 已完整同步
这个数据集是一个面向桌面整理任务的机器人操作数据集,采用与 LeRobot 兼容的扩展格式。它涵盖了家庭和办公室两种典型场景,包含抓取、捡拾和放置三种原子动作,共收集了 1070 个演示片段,总帧数超过 200 万,帧率为 30fps,数据量约 32.3GB。数据集内包含 6 个主要任务(如将香蕉放到盘子里、把废纸丢进篮子、将水杯直立摆放在盘子旁边等),并进一步细分为 108 个子任务。文本描述同时支持中英文,便于不同语言背景的研究者使用。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 31 GiB 5165 个文件 WeHub 同步于 2026-08-07 02:55:38 +00:00
Cobot_Magic_pull_zipper 可在线预览 已完整同步
这是一个机器人操作数据集,专注于使用两指夹爪执行拉链拉开与拉合动作。数据集包含1868个演示片段、超过83万帧图像,涵盖6个主要任务和14个细分子任务,均在家庭场景中采集。每个片段提供3个相机视角,并包含丰富的标注信息,如子任务分割、场景描述、末端执行器运动方向与速度、夹爪开合状态等,适合用于机器人模仿学习与操作技能研究。
GITATTRIBUTESJSONJSONLMDMP4PARQUET Apache License 2.0 11 GiB 7486 个文件 WeHub 同步于 2026-08-07 02:55:34 +00:00
AI-MO/NuminaMath-CoT 可在线预览 已完整同步
NuminaMath-CoT 是数学推理训练与评测数据集,包含约 86 万道数学题及对应解答,字段包括题目、解答、来源和多轮消息,并提供训练集与测试集。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.1 GiB 8 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个从ShareGPT对话中精选的英文对话数据集,经过严格清洗得到约5.3万条高质量样本。清洗过程移除了非英语内容、大量重复字符,并过滤掉了包含常见“AI道德说教”短语的对话,旨在减少模型训练中的安全拒绝倾向。数据集提供两个版本,其中一个额外去掉了含有“I'm sorry, but”的实例,使用者可根据需求选择。适合用于训练开放、少限制的对话模型。
GITATTRIBUTESIPYNBJSONMDPYWHL Apache License 2.0 4.0 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个包含约9万张合成数字签名图片的数据集,涵盖了30种手写与签名风格的字体。每种字体提供3000张签名样本,图片格式统一为PNG。数据集可用于训练和评估数字签名检测、字体识别以及文档验证等计算机视觉任务,特别适用于识别那些通过键盘输入、模仿真实手写签名的“打字数字签名”。
GITATTRIBUTESMDPNG MIT License 142 MiB 32845 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Tongyi-MAI/Z-Image-Turbo 已完整同步
Z-Image-Turbo 是一个高效的图像生成模型,基于单流扩散 Transformer 架构,拥有 6B 参数。它通过蒸馏技术实现了仅需 8 步评估即可生成高质量图像,推理延迟可低至亚秒级,并能在 16G 显存的消费级设备上运行。该模型擅长生成逼真的图像,支持中英文双语文本渲染,且具备良好的指令跟随能力。此外,该系列还包括 Z-Image 基础模型、支持生成与编辑的 Z-Image-Omni-Base 以及专注于图像编辑的 Z-Image-Edit 等变体,覆盖了从高质量生成到精细编辑的多种场景。
GITATTRIBUTESJPGJSONMDPDFPNGSAFETENSORSTXTWEBP Apache License 2.0 31 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cais/mmlu 可在线预览 已完整同步
MMLU 是英文多任务语言理解评测集,覆盖抽象代数、法律、医学、计算机科学等多个学科,以多项选择题评估模型的知识与推理能力。
GITATTRIBUTESJSONMDPARQUETPYTAR MIT License 258 MiB 181 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个基于 MiniLM-L6 架构的 Cross-Encoder 模型,专门针对 MS Marco 段落排序任务训练而成。它主要用于信息检索中的重排序阶段:给定一个查询,先通过检索工具(如 ElasticSearch)召回一批候选段落,再用该模型对每个查询‑段落对进行相关性打分,最后按分数降序排列,以提升排序质量。模型可通过 SentenceTransformers 或 Transformers 库直接调用,输入查询和段落文本,即可输出相关性分数。在 TREC Deep Learning 2019 和 MS Marco 开发集上,它均取得了较好的排序效果,兼顾了速度与准确度。
BINGITATTRIBUTESJSONMDMSGPACKONNXSAFETENSORSTXTXML Apache License 2.0 849 MiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wormtooth/MNBVC-judgment 已完整同步
MNBVC-judgment 是中文裁判文书语料,采用 MNBVC 通用数据格式并以压缩文件提供,适合用于法律文本处理与中文语言模型研究。
GITATTRIBUTESGZMD MIT License 116 GiB 996 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
zai-org/CogVideoX-2b 已完整同步
CogVideoX-2B 是一个文本到视频的生成模型,能够根据英文描述生成连贯的视频内容。该模型采用 Apache-2.0 开源许可证,适用于视频生成相关的研究和应用。
GITATTRIBUTESGITIGNOREJSONMDMODELSAFETENSORS Apache License 2.0 13 GiB 19 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Ming-UniAudio 是一个统一的语音理解、生成与编辑框架,其核心创新在于提出了一种基于 VAE 架构的连续语音分词器,首次将语义与声学特征有效融合,使同一个语言模型既能理解语音也能生成语音。在此基础上,该模型通过扩散头增强生成保真度,并进一步训练出首个仅凭自然语言指令即可完成自由形式语音编辑的模型,无需人工指定待编辑区域,支持复杂的语义和声学修改。
GITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 34 GiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ASLP-lab/DiffRhythm2 已完整同步
DiffRhythm 2 是新一代开源音乐生成框架,基于半自回归扩散架构,能够生成完整歌曲,并实现精确的歌词对齐与连贯的音乐结构。其名称中的“Diff”代表扩散生成主干,“Rhythm”强调对音乐性与时间流动的专注,中文名“谛韵”则融合了“谛”(专注聆听)与“韵”(旋律魅力)的双重寓意。
BINGITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 4.7 GiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/VoxCPM1.5 已完整同步
VoxCPM1.5 是一个无需分词器的文本转语音(TTS)系统,能够生成上下文感知、富有表现力的语音,并实现逼真的零样本声音克隆。该模型基于 MiniCPM4-0.5B,采用扩散自回归架构直接生成连续语音表示,在 180 万小时双语语料上训练。相比前代版本,它支持 44.1kHz 高采样率输出,提高了音质,同时将 token 率降至 6.25Hz,提升效率。支持流式合成,实时因子低至 0.17,并可通过 SFT 或 LoRA 进行微调,适配个性化语音模型。
GITATTRIBUTESJSONMDPNGPTHSAFETENSORS Apache License 2.0 1.8 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
zai-org/GLM-TTS 已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
CKPTGITATTRIBUTESJSONMDMODELPTPYSAFETENSORSYAML MIT License 8.3 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZhejiangLab/Gengram 已完整同步
Gengram-10B 是一个为基因组基础模型设计的条件记忆模块,通过显式基序记忆检索增强基于 Transformer 的 DNA 序列建模。它采用哈希查找表存储和检索 k-mer(k=1-6),并引入 21 碱基对窗口机制以对齐 DNA 螺旋结构,在保持线性时间复杂度的同时提升计算效率。该模块兼容多种注意力机制(如 MHA、GQA、MLA),支持混合专家模型中的负载均衡,并具备生物可解释性:记忆嵌入呈现反向互补对称性,门控机制随功能区域变化,从浅层到深层形成层次化表示。
DISTCPGITATTRIBUTESJSONMDMETADATAPTTXT Apache License 2.0 145 GiB 1033 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
sarosavo/Master-RM 已完整同步
这是一个用于训练鲁棒生成式奖励模型(Master-RM)的合成数据集,包含约18万条训练样本。每条样本由问题、回答和二元偏好标签组成,适用于监督微调、偏好优化等任务。数据集特别针对生成式奖励模型容易被表面操作(如无意义符号或推理开头)欺骗的漏洞进行了增强,通过额外添加2万个负例样本,帮助模型提升抵抗这类攻击的鲁棒性。
GITATTRIBUTESJSONMD Apache License 2.0 310 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
JunkaiZ/Rubrics 可在线预览 已完整同步
该数据集包含用于文本分类的评分标准(rubrics),覆盖健康、通用和金融三个领域。其中健康与通用领域各有5000条训练提示及对应评分标准,并额外提供1000条提示用于端到端胜率对比;金融领域提供1145条训练提示及评分标准。数据以JSONL格式存储,可用于基于评分标准的强化学习奖励建模。
GITATTRIBUTESJSONJSONLMD MIT License 61 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-SALA 已完整同步
MiniCPM-SALA是一种创新的大规模混合注意力模型,首次将稀疏注意力与线性注意力高效融合,专为百万级令牌的上下文建模设计。它采用25%的稀疏注意力层(基于InfLLM-v2)和75%的线性注意力层(Lightning Attention),在保持高保真长上下文建模能力的同时,突破了计算和内存瓶颈,实现了3.5倍的推理加速,并显著降低KV缓存开销。通过混合位置编码(HyPE)和基于蒸馏的HALO训练策略,该模型能够扩展到百万令牌以上的上下文长度,同时在通用知识、数学和代码等任务上保持与全注意力模型相当的性能。
GITATTRIBUTESJSONMDMODELPYSAFETENSORS Apache License 2.0 18 GiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PKU-DS-LAB/FairyR1-32B 已完整同步
FairyR1-32B 是一个高效的大语言模型,由北京大学 DS-LAB 团队开发。它基于 DeepSeek‑R1‑Distill‑Qwen‑32B 构建,采用创新的“蒸馏-融合”流程,仅用约 5% 的参数规模,便在数学竞赛(如 AIME 2024/2025)和代码生成(如 LiveCodeBench)等任务上取得了与 DeepSeek‑R1‑671B 相当甚至更优的成绩。该模型通过优化数据蒸馏管道和多专家模型融合,在显著降低推理成本的同时,保持了出色的任务性能。
GITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 61 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
thu-pacman/PCMind-2.1-Kaiyuan-2B 可在线预览 已完整同步
这个数据集是为PCMind-v2.1-Kaiyuan-2B语言模型提供的完整预训练数据集,总规模超过1TB。它包含5个训练阶段,覆盖英语、中文、代码、数学和SFT五大领域,并采用领域特定的混合策略和两种采样方式(前两阶段均匀采样,后三阶段基于课程学习排序)。数据以文本形式呈现,支持中英文,适用于文本生成任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 2.8 TiB 660 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00