数据集

4 个数据集
已选筛选: 文本生成 PY MIT 清除所有筛选
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
DEEPSEEKGITATTRIBUTESJPGJSONMDPDFPYSAFETENSORS MIT License 641 GiB 173 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
inclusionAI/Ring-1T 已完整同步
Ring-1T 是一个万亿参数级别的开源思考模型,采用 Ling 2.0 架构,总参数量达 1 万亿,激活参数为 500 亿,支持最长 128K 的上下文窗口。该模型通过大规模可验证奖励强化学习(RLVR)训练,显著提升了自然语言推理能力,并经过 RLHF 优化使通用能力更加均衡,在数学竞赛、代码生成和逻辑推理等挑战性基准上表现领先。
GITATTRIBUTESJSONMDPYSAFETENSORS MIT License 1.8 TiB 170 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-V3.2-REAP-345B-A37B 是一个基于 DeepSeek-V3.2 高效压缩而来的稀疏混合专家(SMoE)语言模型。通过名为 REAP 的专家剪枝方法,模型在保留路由器对剩余专家独立控制的前提下,均匀剪除了 50% 的专家,参数量从 671B 压缩至 345B,每 token 仅激活 37B 参数。该模型在代码生成、数学推理、工具调用等任务上保持了近乎无损的性能,同时显著降低了内存占用和部署成本。它可直接兼容标准 vLLM 推理框架,无需额外修改,特别适合资源受限环境、本地部署及学术研究场景。
JSONMDPYSAFETENSORSTXT MIT License 323 GiB 87 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
XiaomiMiMo/MiMo-V2-Flash 已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT MIT License 292 GiB 157 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00