数据集

39 个数据集
已选筛选: PY 清除所有筛选
Bill13579/beltout 已完整同步
BeltOut 是一个基于 ChatterboxVC 的零样本语音到语音音色迁移模型,能够在不改变原始表演细节(如语调、情感)的前提下,仅替换音色(timbre)。它通过 192 维的 x-vector 表示任意音色,可应用于任意输入语音,实现精准的音色转换。该模型旨在学习音色对表演传递的通用影响,从而生成与目标音色一致的完整语音输出。
GITATTRIBUTESGITIGNORELOCKMDMP4NPYPYRSSAFETENSORSTOMLWAV MIT License 6.6 GiB 126 个文件 WeHub 同步于 2026-08-28 11:48:26 +00:00
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
GITATTRIBUTESGITIGNOREJSONMDMODELPTPYSAFETENSORSTXTYAML MIT License 40 GiB 64 个文件 WeHub 同步于 2026-08-28 10:58:25 +00:00
yiliu666/xiaoduan 已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
APKDMGEXEGITATTRIBUTESHTMLJSJSONMDPCKPDFPKGPNGPYTXTWASMZIP Apache License 2.0 3.8 GiB 63 个文件 WeHub 同步于 2026-08-22 18:38:19 +00:00
modelscope/mmlu 已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
GITATTRIBUTESJSONMDPYTAR Apache License 2.0 159 MiB 6 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
该数据集是一个用于图像描述(image captioning)任务的数据集,包含训练和验证两个子集。每条数据由图像、对应的描述文本以及图像ID组成,适合用于训练和评估图像描述模型。数据集规模在10k到1m之间,语言为英文。
JSONMDPY Apache License 2.0 7.6 KiB 3 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
CMMLU 是中文大规模多任务语言理解评测集,覆盖多个知识学科和任务类别,通过中文多项选择题评估模型的知识与理解能力。
MDPYZIP Apache License 2.0 1.0 MiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
baicai003/Llama3-Chinese-dataset 可在线预览 已完整同步
这是一个为训练Llama3中文模型而整合的多源指令微调数据集。它融合了英文通用指令、中文知乎问答、ShareGPT对话、中文常识任务、成语、诗词、逻辑推理、小红书风格文本等多种数据,并统一处理为firefly格式,便于直接训练。数据集包含约169万条清洗后的问答对,支持按需选择子集或合并使用,适合用于提升模型的中文理解和生成能力。
GITATTRIBUTESJSONLMDPY Apache License 2.0 4.0 GiB 23 个文件 WeHub 同步于 2026-08-20 02:08:19 +00:00
modelscope/gsm8k 已完整同步
GSM8K 是小学数学文字题与解答资源,当前镜像包含 JSON、脚本和说明文件,适合数学推理训练样例、模型评测和教育研究。
JSONMDPY Apache License 2.0 6.2 KiB 3 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
opencompass/mmlu 可在线预览 已完整同步
MMLU(大规模多任务语言理解)是一个涵盖57个学科的多选题数据集,用于评估语言模型在广泛知识领域的理解能力。数据集包含问题、四个选项和正确答案,覆盖从抽象代数、天文学到临床知识等众多领域,提供了测试集、验证集和开发集等划分。
GITATTRIBUTESJSONMDPARQUETPYTAR Apache License 2.0 258 MiB 181 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
本数据集收录了高校录取分数和位次信息,字段齐全、数据规模充足,适合用于高校招生与录取相关分析。使用时需注意按派生或索引口径进行处理。数据提供 JSON、CSV 等多种格式。
CSVGITIGNOREJSJSONMDPY 104 MiB 2712 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
这是一个从ShareGPT对话中精选的英文对话数据集,经过严格清洗得到约5.3万条高质量样本。清洗过程移除了非英语内容、大量重复字符,并过滤掉了包含常见“AI道德说教”短语的对话,旨在减少模型训练中的安全拒绝倾向。数据集提供两个版本,其中一个额外去掉了含有“I'm sorry, but”的实例,使用者可根据需求选择。适合用于训练开放、少限制的对话模型。
GITATTRIBUTESIPYNBJSONMDPYWHL Apache License 2.0 4.0 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cais/mmlu 可在线预览 已完整同步
MMLU 是英文多任务语言理解评测集,覆盖抽象代数、法律、医学、计算机科学等多个学科,以多项选择题评估模型的知识与推理能力。
GITATTRIBUTESJSONMDPARQUETPYTAR MIT License 258 MiB 181 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
zai-org/GLM-TTS 已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
CKPTGITATTRIBUTESJSONMDMODELPTPYSAFETENSORSYAML MIT License 8.3 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-SALA 已完整同步
MiniCPM-SALA是一种创新的大规模混合注意力模型,首次将稀疏注意力与线性注意力高效融合,专为百万级令牌的上下文建模设计。它采用25%的稀疏注意力层(基于InfLLM-v2)和75%的线性注意力层(Lightning Attention),在保持高保真长上下文建模能力的同时,突破了计算和内存瓶颈,实现了3.5倍的推理加速,并显著降低KV缓存开销。通过混合位置编码(HyPE)和基于蒸馏的HALO训练策略,该模型能够扩展到百万令牌以上的上下文长度,同时在通用知识、数学和代码等任务上保持与全注意力模型相当的性能。
GITATTRIBUTESJSONMDMODELPYSAFETENSORS Apache License 2.0 18 GiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-V-4_5 已完整同步
MiniCPM-V 4.5 是一款基于 Qwen3-8B 和 SigLIP2-400M 构建的多模态大语言模型,总参数量为 8B。它在视觉语言能力上表现出色,在多项基准测试中平均得分超过 GPT-4o-latest 等主流模型,并支持高效的高帧率视频理解,通过 3D 重采样器实现 96 倍视频 token 压缩。该模型具备可控的快速与深度思考模式切换,以及强大的 OCR、文档解析和多语言处理能力,支持最高 1.8 百万像素的高分辨率图像输入,并提供了多种量化与推理方式以适配不同使用场景。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 16 GiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Wan-AI/Wan2.2-S2V-14B 已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
BINBINARYGITATTRIBUTESJSONMDMODELMP4MSCMSGPACKMVPNGPTHPYSAFETENSORSSHTXT Apache License 2.0 46 GiB 49 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
IWR-Bench/IWR-Bench 可在线预览 已完整同步
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
BMPGIFGITATTRIBUTESJPGJSONLMDMP4PNGPYSVGWEBP Apache License 2.0 2.5 GiB 9779 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
DEEPSEEKGITATTRIBUTESJPGJSONMDPDFPYSAFETENSORS MIT License 641 GiB 173 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/Video-XL-2 已完整同步
Video-XL-2 是一个支持视频与文本交互的多模态模型,能够根据视频内容回答用户的问题。它针对长视频场景提供了两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层 KV 缓存解码(bi-level kvs decoding),可以有效降低显存占用和响应延迟,适合处理较长视频的推理任务。
BINGITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 15 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
inclusionAI/Ring-1T 已完整同步
Ring-1T 是一个万亿参数级别的开源思考模型,采用 Ling 2.0 架构,总参数量达 1 万亿,激活参数为 500 亿,支持最长 128K 的上下文窗口。该模型通过大规模可验证奖励强化学习(RLVR)训练,显著提升了自然语言推理能力,并经过 RLHF 优化使通用能力更加均衡,在数学竞赛、代码生成和逻辑推理等挑战性基准上表现领先。
GITATTRIBUTESJSONMDPYSAFETENSORS MIT License 1.8 TiB 170 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00