数据集

2 个数据集
已选筛选: py PT 清除所有筛选
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORS Apache License 2.0 40 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORSTXT Apache License 2.0 8.0 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00