数据集
9 个数据集
热门分类:
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
心理咨询师数字孪生对话数据集
已完整同步
该数据集包含多轮心理咨询对话,用于构建心理咨询师的数字孪生模型。数据基于少量真实咨询案例,通过大语言模型生成,保留了特定咨询师的语言风格与疗法技术,涵盖单轮与多轮对话。训练集约4760个对话,测试集约240个对话,总计超9万轮次,适合用于微调模型以模拟具有个性化咨询风格的心理健康助理。
Qwen3-30B-A3B-Thinking-2507 是一个基于 Transformer 的因果语言模型,采用混合专家(MoE)架构,总参数量为 30.5B,每次推理仅激活 3.3B 参数。它原生支持高达 262K 的上下文长度,在逻辑推理、数学、科学、编程等复杂推理任务上表现显著提升,同时指令遵循、工具使用、文本生成等通用能力也有明显增强。该模型默认开启深度思考模式,特别适合处理高复杂度的推理场景。
inclusionAI/Ring-1T
已完整同步
Ring-1T 是一个万亿参数级别的开源思考模型,采用 Ling 2.0 架构,总参数量达 1 万亿,激活参数为 500 亿,支持最长 128K 的上下文窗口。该模型通过大规模可验证奖励强化学习(RLVR)训练,显著提升了自然语言推理能力,并经过 RLHF 优化使通用能力更加均衡,在数学竞赛、代码生成和逻辑推理等挑战性基准上表现领先。
这是一个基于 Qwen3-30B-A3B 的 GGUF 格式量化模型,支持 128K 上下文长度,采用 Unsloth Dynamic 2.0 量化技术,在保持较高精度的同时优化了运行效率。该模型可在 llama.cpp、Ollama 等框架中直接使用,并支持通过 `/think` 和 `/no_think` 指令在推理过程中切换模型的思考模式,方便多轮对话中的灵活控制。
XiaomiMiMo/MiMo-V2-Flash
已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
DeepAnalyze-8B 是一个面向自主数据科学领域的智能体大语言模型,能够无需人工干预自动完成数据准备、分析、建模、可视化和报告生成等一系列数据科学任务。它支持结构化数据(如数据库、CSV、Excel)、半结构化数据(如 JSON、XML、YAML)和非结构化数据(如 TXT、Markdown),并可生成分析师级的研究报告。该模型已完全开源,方便用户部署或扩展自己的数据分析助手。
DeepSeek-R1-0528 是 DeepSeek R1 模型的一次小版本升级,重点提升了推理深度和推理能力。通过增加计算资源并引入算法优化,该模型在数学、编程、通用逻辑等多项基准测试中表现出色,整体性能已接近 O3 和 Gemini 2.5 Pro 等领先模型。例如,在 AIME 2025 测试中,准确率从之前版本的 70% 提升至 87.5%,平均每道题使用的推理 token 从 12K 增加到 23K,体现了更深的思考过程。此外,新版本还降低了幻觉率,增强了函数调用支持,并优化了 vibe coding 体验。模型最大生成长度为 64K tokens。