数据集

3 个数据集
已选筛选: 大语言模型 JSON 数据集 清除所有筛选
MSAgent-Bench-中文Agent数据集 可在线预览 已完整同步
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 2.1 GiB 6 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
该数据集包含多轮心理咨询对话,用于构建心理咨询师的数字孪生模型。数据基于少量真实咨询案例,通过大语言模型生成,保留了特定咨询师的语言风格与疗法技术,涵盖单轮与多轮对话。训练集约4760个对话,测试集约240个对话,总计超9万轮次,适合用于微调模型以模拟具有个性化咨询风格的心理健康助理。
GITATTRIBUTESJSONMD Apache License 2.0 76 MiB 5 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
这是一个基于 Qwen3-30B-A3B 的 GGUF 格式量化模型,支持 128K 上下文长度,采用 Unsloth Dynamic 2.0 量化技术,在保持较高精度的同时优化了运行效率。该模型可在 llama.cpp、Ollama 等框架中直接使用,并支持通过 `/think` 和 `/no_think` 指令在推理过程中切换模型的思考模式,方便多轮对话中的灵活控制。
DATGGUFGITATTRIBUTESJSONMD Apache License 2.0 395 GiB 33 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00