数据集
3 个数据集
热门分类:
PKU-DS-LAB/FairyR1-32B
已完整同步
FairyR1-32B 是一个高效的大语言模型,由北京大学 DS-LAB 团队开发。它基于 DeepSeek‑R1‑Distill‑Qwen‑32B 构建,采用创新的“蒸馏-融合”流程,仅用约 5% 的参数规模,便在数学竞赛(如 AIME 2024/2025)和代码生成(如 LiveCodeBench)等任务上取得了与 DeepSeek‑R1‑671B 相当甚至更优的成绩。该模型通过优化数据蒸馏管道和多专家模型融合,在显著降低推理成本的同时,保持了出色的任务性能。
Nanbeige/Nanbeige4.1-3B
已完整同步
Nanbeige4.1-3B 是基于 Nanbeige4-3B-Base 构建的轻量级推理模型,通过监督微调与强化学习进一步优化,在保持小参数规模的同时展现出强大的推理能力、偏好对齐效果和智能体行为。它能够通过单次前向传播完成复杂多步推理,并在代码、数学、科学等多项基准测试中超越同规模及部分更大模型。此外,Nanbeige4.1-3B 原生支持深度搜索任务,可稳定执行超过 500 轮工具调用,填补了小型模型在通用推理与智能体场景中兼顾不足的空白。
DeepSeek-R1-0528 是 DeepSeek R1 模型的一次小版本升级,重点提升了推理深度和推理能力。通过增加计算资源并引入算法优化,该模型在数学、编程、通用逻辑等多项基准测试中表现出色,整体性能已接近 O3 和 Gemini 2.5 Pro 等领先模型。例如,在 AIME 2025 测试中,准确率从之前版本的 70% 提升至 87.5%,平均每道题使用的推理 token 从 12K 增加到 23K,体现了更深的思考过程。此外,新版本还降低了幻觉率,增强了函数调用支持,并优化了 vibe coding 体验。模型最大生成长度为 64K tokens。