数据集
5 个数据集
热门分类:
inclusionAI/Ring-1T
已完整同步
Ring-1T 是一个万亿参数级别的开源思考模型,采用 Ling 2.0 架构,总参数量达 1 万亿,激活参数为 500 亿,支持最长 128K 的上下文窗口。该模型通过大规模可验证奖励强化学习(RLVR)训练,显著提升了自然语言推理能力,并经过 RLHF 优化使通用能力更加均衡,在数学竞赛、代码生成和逻辑推理等挑战性基准上表现领先。
XiaomiMiMo/MiMo-V2-Flash
已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
DeepAnalyze-8B 是一个面向自主数据科学领域的智能体大语言模型,能够无需人工干预自动完成数据准备、分析、建模、可视化和报告生成等一系列数据科学任务。它支持结构化数据(如数据库、CSV、Excel)、半结构化数据(如 JSON、XML、YAML)和非结构化数据(如 TXT、Markdown),并可生成分析师级的研究报告。该模型已完全开源,方便用户部署或扩展自己的数据分析助手。
DeepSeek-R1-0528 是 DeepSeek R1 模型的一次小版本升级,重点提升了推理深度和推理能力。通过增加计算资源并引入算法优化,该模型在数学、编程、通用逻辑等多项基准测试中表现出色,整体性能已接近 O3 和 Gemini 2.5 Pro 等领先模型。例如,在 AIME 2025 测试中,准确率从之前版本的 70% 提升至 87.5%,平均每道题使用的推理 token 从 12K 增加到 23K,体现了更深的思考过程。此外,新版本还降低了幻觉率,增强了函数调用支持,并优化了 vibe coding 体验。模型最大生成长度为 64K tokens。