数据集

168 个数据集
已选筛选: JSON 清除所有筛选
BAAI/bge-code-v1 已完整同步
BAAI/bge-code-v1 是一个基于大语言模型的代码嵌入模型,专注于代码检索、文本检索和多语言检索。它能够用中英文自然语言查询以及 20 种编程语言进行高效代码检索,同时保持与同等规模文本嵌入模型相当的文本检索能力,并支持英语、中文、日语、法语等多种语言。该模型基于 sentence-transformers 框架,采用 Apache-2.0 许可证。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 5.8 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-v1.5-zs 已完整同步
BGE-VL是一系列面向通用多模态检索的嵌入模型,包括基于CLIP的base和large版本,以及融合多模态大语言模型的MLLM版本。这些模型借助MegaPairs数据集进行训练——该数据集通过创新的合成方法,利用开放域图像生成了超过2600万条异构KNN三元组,显著提升了多模态检索的性能。在组合图像检索等任务中,BGE-VL-MLLM模型相比此前最优方法取得了8.1%的改进。
GITATTRIBUTESJINJAJSONMDMODELPNGPYSAFETENSORS MIT License 9.5 GiB 29 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-Screenshot 已完整同步
BAAI/BGE-VL-Screenshot 是一个面向视觉化信息检索(VisIR)的模型,能将文本、图像、表格、图表等多模态信息统一表示为截图形式,实现跨模态检索。它基于 Qwen2.5-VL-3B-Instruct 构建,采用 sentence-transformers 框架,支持中英文等多种语言,并配套了大规模截图数据集 VIRA 和综合评测基准 MVRB,旨在提升检索模型在处理多模态信息时的表现。
GITATTRIBUTESJINJAJPEGJSONMDPNGPYSAFETENSORSTXT MIT License 3.5 GiB 26 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Kwai-Keye/Keye-VL-1_5-8B 已完整同步
Kwai Keye-VL-1.5 是一款前沿的多模态大语言模型,专注于视频理解与推理。它采用了创新的“慢-快”视频编码策略,通过渐进式四阶段预训练方法将上下文长度扩展至128K tokens,并设计了全面的后训练流程,以增强推理能力和对齐人类偏好。该模型在视频理解任务上表现出显著提升,同时在其他多模态基准测试中保持竞争力。
GITATTRIBUTESJPEGJSONMDPNGPYSAFETENSORSTXT Apache License 2.0 16 GiB 36 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Fun-CosyVoice 3.0 是一个基于大语言模型的先进文本转语音(TTS)系统,在内容一致性、说话人相似度和韵律自然度上均超越前代。它支持9种常见语言(中、英、日、韩、德、西、法、意、俄)以及18种以上中文方言/口音,同时具备跨语言零样本语音克隆能力。系统还提供发音修复、文本标准化、低延迟流式输出和指令控制(如语言、情感、语速、音量)等实用功能,适合生产环境使用。
GITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSTXTYAML Apache License 2.0 9.1 GiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HiDream-ai/HiDream-E1-Full 已完整同步
HiDream-E1 是一个基于指令驱动的图像编辑模型,能够根据用户提供的自然语言描述对输入图像进行编辑。它支持灵活的编辑指令格式,例如“将图片转换为吉卜力风格”,并配合目标图像描述来精确控制输出效果。该模型结合了 Llama 3.1 文本编码器与扩散 Transformer 架构,可在保持图像整体结构的同时实现多样化的风格转换和内容修改。
GITATTRIBUTESJPGJSONMDMODELSAFETENSORSTXT MIT License 44 GiB 37 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
0xSero/GLM-4.7-185B-W4A16 已完整同步
GLM-4.7-185B-W4A16 是一个经过 4 比特权重量化(W4A16)的混合专家(MoE)模型,基于 GLM-4.7-185B 压缩而来。模型总参数量为 1850 亿,采用 INT4 权重与 FP16 激活的格式,磁盘占用约 99 GB,适用于文本生成任务。该量化版本在保持模型能力的同时显著降低了存储和推理时的显存需求。
GITATTRIBUTESJINJAJSONMDPYSAFETENSORS Apache License 2.0 92 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LongCat-Image 是一个开源的、中英双语的图像生成基础模型,拥有60亿参数。它在保持高效性能的同时,在多个基准测试中超越了数倍于自身规模的模型,尤其擅长中文文字渲染,能准确稳定地生成常见汉字,并覆盖了广泛的汉字字典。此外,该模型通过创新的数据策略和训练框架,能够生成具有出色照片级真实感的图像。
GITATTRIBUTESJPEGJPGJSONMDSAFETENSORSSVGTXT Apache License 2.0 27 GiB 36 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORS Apache License 2.0 40 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORSTXT Apache License 2.0 8.0 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Nanbeige/Nanbeige4.1-3B 已完整同步
Nanbeige4.1-3B 是基于 Nanbeige4-3B-Base 构建的轻量级推理模型,通过监督微调与强化学习进一步优化,在保持小参数规模的同时展现出强大的推理能力、偏好对齐效果和智能体行为。它能够通过单次前向传播完成复杂多步推理,并在代码、数学、科学等多项基准测试中超越同规模及部分更大模型。此外,Nanbeige4.1-3B 原生支持深度搜索任务,可稳定执行超过 500 轮工具调用,填补了小型模型在通用推理与智能体场景中兼顾不足的空白。
GITATTRIBUTESJSONMDMODELPDFPNGSAFETENSORS Apache License 2.0 7.3 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
nari-labs/Dia-1.6B 已完整同步
Dia是一个拥有1.6B参数的文本到语音模型,能够直接从脚本生成高度逼真的对话。它支持通过音频条件控制情感和语调,还能输出笑声、咳嗽等非语言声音。目前仅支持英文生成。
GITATTRIBUTESJSONMDPTHSAFETENSORS Apache License 2.0 12 GiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
inclusionAI/Ring-2.5-1T 已完整同步
Ring-2.5-1T 是全球首个开源万亿参数思考模型,采用混合线性注意力架构。它在生成效率上通过高比例线性注意力机制,将超过32K token序列的内存访问开销降低10倍以上,生成吞吐量提升3倍多;在深度思考方面,借助密集奖励的RLVR训练,实现了IMO 2025和CMO 2025的金牌级推理水平;在长程任务执行上,经过大规模全异步智能体强化学习训练,可轻松适配Claude Code、OpenClaw等编程框架,支持复杂任务的长期自主执行。
GITATTRIBUTESJINJAJSONMDPYSAFETENSORS MIT License 396 GiB 171 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/QwQ-32B 已完整同步
QwQ-32B是Qwen系列中的推理模型,拥有32.5B参数,基于Transformer架构,支持最长131,072 tokens的上下文。它经过预训练、监督微调与强化学习,具备深度思考与推理能力,在复杂任务上表现优异,可对标业界领先的推理模型。
GITATTRIBUTESJPGJSONMDSAFETENSORSTXT Apache License 2.0 57 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SparkAudio/Spark-TTS-0.5B 已完整同步
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。
BINGITATTRIBUTESJPGJSONMDPNGSAFETENSORSTXTYAML Apache License 2.0 3.7 GiB 31 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RUC-DataLab/DeepAnalyze-8B 已完整同步
DeepAnalyze-8B 是一个面向自主数据科学领域的智能体大语言模型,能够无需人工干预自动完成数据准备、分析、建模、可视化和报告生成等一系列数据科学任务。它支持结构化数据(如数据库、CSV、Excel)、半结构化数据(如 JSON、XML、YAML)和非结构化数据(如 TXT、Markdown),并可生成分析师级的研究报告。该模型已完全开源,方便用户部署或扩展自己的数据分析助手。
GITATTRIBUTESJPGJSONMDPNGSAFETENSORS MIT License 15 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RUC-DataLab/DataScience-Instruct-500K 可在线预览 已完整同步
该数据集包含约50万条数据科学指令,用于训练能够自主完成数据科学任务的大语言模型。内容覆盖数据准备、分析、建模、可视化和报告生成等完整流程,支持对结构化、半结构化和非结构化数据的研究分析。
GITATTRIBUTESJPGJSONMDPARQUETPNGZIP MIT License 13 GiB 38 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-R1-0528 是 DeepSeek R1 模型的一次小版本升级,重点提升了推理深度和推理能力。通过增加计算资源并引入算法优化,该模型在数学、编程、通用逻辑等多项基准测试中表现出色,整体性能已接近 O3 和 Gemini 2.5 Pro 等领先模型。例如,在 AIME 2025 测试中,准确率从之前版本的 70% 提升至 87.5%,平均每道题使用的推理 token 从 12K 增加到 23K,体现了更深的思考过程。此外,新版本还降低了幻觉率,增强了函数调用支持,并优化了 vibe coding 体验。模型最大生成长度为 64K tokens。
GITATTRIBUTESJSONMDPNGSAFETENSORS MIT License 15 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MedAIBase/AntAngelMed 已完整同步
AntAngelMed 是当前最大的开源医疗语言模型,由浙江省卫健委、蚂蚁集团及浙江省安诊儿医学人工智能科技有限公司联合研发。它在 OpenAI 的 HealthBench 和中文权威评测 MedAIBench 上均取得领先成绩,尤其在 Hard 子集上表现突出。该模型采用高效 MoE 架构,总参数 100B 但仅激活 6.1B,推理速度可达 200 tokens/s 以上,同时支持 128K 上下文长度。通过医学语料持续预训练、高质量指令微调及 GRPO 强化学习,模型具备了深入的医学知识、严谨的诊断推理能力以及良好的安全伦理遵循。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 35 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00