数据集

135 个数据集
已选筛选: GITATTRIBUTES Apache-2.0 清除所有筛选
openbmb/VoxCPM1.5 已完整同步
VoxCPM1.5 是一个无需分词器的文本转语音(TTS)系统,能够生成上下文感知、富有表现力的语音,并实现逼真的零样本声音克隆。该模型基于 MiniCPM4-0.5B,采用扩散自回归架构直接生成连续语音表示,在 180 万小时双语语料上训练。相比前代版本,它支持 44.1kHz 高采样率输出,提高了音质,同时将 token 率降至 6.25Hz,提升效率。支持流式合成,实时因子低至 0.17,并可通过 SFT 或 LoRA 进行微调,适配个性化语音模型。
GITATTRIBUTESJSONMDPNGPTHSAFETENSORS Apache License 2.0 1.8 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZhejiangLab/Gengram 已完整同步
Gengram-10B 是一个为基因组基础模型设计的条件记忆模块,通过显式基序记忆检索增强基于 Transformer 的 DNA 序列建模。它采用哈希查找表存储和检索 k-mer(k=1-6),并引入 21 碱基对窗口机制以对齐 DNA 螺旋结构,在保持线性时间复杂度的同时提升计算效率。该模块兼容多种注意力机制(如 MHA、GQA、MLA),支持混合专家模型中的负载均衡,并具备生物可解释性:记忆嵌入呈现反向互补对称性,门控机制随功能区域变化,从浅层到深层形成层次化表示。
DISTCPGITATTRIBUTESJSONMDMETADATAPTTXT Apache License 2.0 145 GiB 1033 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
sarosavo/Master-RM 已完整同步
这是一个用于训练鲁棒生成式奖励模型(Master-RM)的合成数据集,包含约18万条训练样本。每条样本由问题、回答和二元偏好标签组成,适用于监督微调、偏好优化等任务。数据集特别针对生成式奖励模型容易被表面操作(如无意义符号或推理开头)欺骗的漏洞进行了增强,通过额外添加2万个负例样本,帮助模型提升抵抗这类攻击的鲁棒性。
GITATTRIBUTESJSONMD Apache License 2.0 310 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-SALA 已完整同步
MiniCPM-SALA是一种创新的大规模混合注意力模型,首次将稀疏注意力与线性注意力高效融合,专为百万级令牌的上下文建模设计。它采用25%的稀疏注意力层(基于InfLLM-v2)和75%的线性注意力层(Lightning Attention),在保持高保真长上下文建模能力的同时,突破了计算和内存瓶颈,实现了3.5倍的推理加速,并显著降低KV缓存开销。通过混合位置编码(HyPE)和基于蒸馏的HALO训练策略,该模型能够扩展到百万令牌以上的上下文长度,同时在通用知识、数学和代码等任务上保持与全注意力模型相当的性能。
GITATTRIBUTESJSONMDMODELPYSAFETENSORS Apache License 2.0 18 GiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PKU-DS-LAB/FairyR1-32B 已完整同步
FairyR1-32B 是一个高效的大语言模型,由北京大学 DS-LAB 团队开发。它基于 DeepSeek‑R1‑Distill‑Qwen‑32B 构建,采用创新的“蒸馏-融合”流程,仅用约 5% 的参数规模,便在数学竞赛(如 AIME 2024/2025)和代码生成(如 LiveCodeBench)等任务上取得了与 DeepSeek‑R1‑671B 相当甚至更优的成绩。该模型通过优化数据蒸馏管道和多专家模型融合,在显著降低推理成本的同时,保持了出色的任务性能。
GITATTRIBUTESJSONMDSAFETENSORS Apache License 2.0 61 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
thu-pacman/PCMind-2.1-Kaiyuan-2B 可在线预览 已完整同步
这个数据集是为PCMind-v2.1-Kaiyuan-2B语言模型提供的完整预训练数据集,总规模超过1TB。它包含5个训练阶段,覆盖英语、中文、代码、数学和SFT五大领域,并采用领域特定的混合策略和两种采样方式(前两阶段均匀采样,后三阶段基于课程学习排序)。数据以文本形式呈现,支持中英文,适用于文本生成任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 2.8 TiB 660 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-V-4_5 已完整同步
MiniCPM-V 4.5 是一款基于 Qwen3-8B 和 SigLIP2-400M 构建的多模态大语言模型,总参数量为 8B。它在视觉语言能力上表现出色,在多项基准测试中平均得分超过 GPT-4o-latest 等主流模型,并支持高效的高帧率视频理解,通过 3D 重采样器实现 96 倍视频 token 压缩。该模型具备可控的快速与深度思考模式切换,以及强大的 OCR、文档解析和多语言处理能力,支持最高 1.8 百万像素的高分辨率图像输入,并提供了多种量化与推理方式以适配不同使用场景。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 16 GiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Wan-AI/Wan2.2-S2V-14B 已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
BINBINARYGITATTRIBUTESJSONMDMODELMP4MSCMSGPACKMVPNGPTHPYSAFETENSORSSHTXT Apache License 2.0 46 GiB 49 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
IWR-Bench/IWR-Bench 可在线预览 已完整同步
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
BMPGIFGITATTRIBUTESJPGJSONLMDMP4PNGPYSVGWEBP Apache License 2.0 2.5 GiB 9779 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RYS-Qwen3.5-27B-FP8-S 是一个基于 Qwen3.5 的 27B 参数因果语言模型,采用 FP8 量化(块大小 128)以降低存储和推理开销,同时保持与原始模型几乎一致的性能。该模型集成了视觉编码器,支持图像到文本的多模态任务,原生上下文长度达 262,144 token,并可扩展至 1,010,000 token。架构上融合了 Gated Delta Networks 与稀疏混合专家(MoE),在高效推理的同时兼顾多模态理解、推理、代码生成和智能体能力。它经过大规模强化学习训练,并支持 201 种语言,适用于全球部署场景。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 29 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RYS-Qwen3.5-27B-FP8-M 是一个基于 Qwen3.5-27B 的 FP8 量化版本,拥有 27B 参数,采用细粒度 128 块大小的 FP8 量化,性能与原始模型几乎一致。它属于因果语言模型,并集成了视觉编码器,支持图像到文本的多模态任务。模型采用高效的 Gated Delta 网络与稀疏 MoE 混合架构,原生支持 262,144 令牌的上下文长度,并可扩展至约 100 万令牌。在训练中引入了可扩展的强化学习,覆盖 201 种语言,在推理、编码、智能体及视觉理解等方面表现出色。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 30 GiB 26 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RYS-Qwen3.5-27B-FP8-L 是基于 Qwen3.5-27B 的 FP8 量化版本,采用块大小为 128 的细粒度量化方法,性能与原始模型几乎一致。该模型融合了多模态学习与高效的混合架构,支持文本和图像输入,原生上下文长度可达 262,144 个token,并可通过扩展支持至超过 100 万 token。它在大规模强化学习训练中表现出色,覆盖 201 种语言,适用于多种复杂场景。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 30 GiB 26 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MYZY-AI/Muyan-TTS 已完整同步
Muyan-TTS是一个面向播客应用的可训练文本转语音模型。它在超过10万小时的播客音频数据上进行了预训练,支持零样本高质量语音合成,并能通过短短几分钟的目标语音实现说话人自适应,从而灵活地定制个性化声音。
GITATTRIBUTESJSONMDPTHSAFETENSORS Apache License 2.0 6.8 GiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
williamium/CoreCognition 可在线预览 已完整同步
CoreCognition 是一个面向多模态大语言模型的核心知识基准数据集,源于发展认知科学中的12项基本能力。它包含1,423个多模态样本和80个概念挑战问题,涉及对象持久性、空间推理、计数等人类直觉中固有的核心能力,旨在评估模型在基础认知任务上的表现。
GITATTRIBUTESJPGMDPARQUETZIP Apache License 2.0 8.1 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
jifanz/stress_testing_model_spec 可在线预览 已完整同步
这个数据集包含多个AI模型在价值冲突场景下的响应,以及不同评判模型对合规性的评估。数据分为三个主要子集:默认子集提供六个精选的分歧场景,涵盖各模型间的高分歧情况;完整子集包含全部超过41万条场景;评判评估子集则收录了约1.5万条由三个评判模型对部分模型响应做出的合规性判断。每个样本都记录了查询文本、多个模型的响应及其在各价值维度上的立场分数,适合用于分析模型在价值权衡中的表现。
GITATTRIBUTESMDPARQUET Apache License 2.0 12 GiB 85 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ByteDance/Q-Insight 已完整同步
Q-Insight 是一个专注于图像质量理解的视觉语言模型,通过视觉强化学习进行训练。它基于 Qwen2.5-VL-7B-Instruct 进行微调,采用 Apache-2.0 开源协议。该模型主要面向图像质量评估(IQA)、视频质量评估(VQA)以及 AIGC 内容的理解任务。
BINGITATTRIBUTESJSONMDNPZPKLPTSAFETENSORSTXT Apache License 2.0 80 GiB 92 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/Video-XL-2 已完整同步
Video-XL-2 是一个支持视频与文本交互的多模态模型,能够根据视频内容回答用户的问题。它针对长视频场景提供了两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层 KV 缓存解码(bi-level kvs decoding),可以有效降低显存占用和响应延迟,适合处理较长视频的推理任务。
BINGITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 15 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个基于 Qwen3-VL-8B-Thinking 的 8 位量化模型,支持图像到文本的生成任务,例如描述图片内容。模型采用 MLX 格式,方便在 Apple 设备上高效运行。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 9.2 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PrimeIntellect/INTELLECT-2-RL-Dataset 可在线预览 已完整同步
这是一个用于训练推理模型的数据集,包含可验证的数学和编程任务。数据集共有约28.5万条训练样本,每条样本包含问题ID、任务类型、提示文本、验证信息以及一个参考模型的解答率等字段。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.6 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个基于 Qwen3-30B-A3B 的 GGUF 格式量化模型,支持 128K 上下文长度,采用 Unsloth Dynamic 2.0 量化技术,在保持较高精度的同时优化了运行效率。该模型可在 llama.cpp、Ollama 等框架中直接使用,并支持通过 `/think` 和 `/no_think` 指令在推理过程中切换模型的思考模式,方便多轮对话中的灵活控制。
DATGGUFGITATTRIBUTESJSONMD Apache License 2.0 395 GiB 33 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00