数据集

46 个数据集
已选筛选: MD MIT 清除所有筛选
RUC-DataLab/DataScience-Instruct-500K 可在线预览 已完整同步
该数据集包含约50万条数据科学指令,用于训练能够自主完成数据科学任务的大语言模型。内容覆盖数据准备、分析、建模、可视化和报告生成等完整流程,支持对结构化、半结构化和非结构化数据的研究分析。
GITATTRIBUTESJPGJSONMDPARQUETPNGZIP MIT License 13 GiB 38 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DeepSeek-R1-0528 是 DeepSeek R1 模型的一次小版本升级,重点提升了推理深度和推理能力。通过增加计算资源并引入算法优化,该模型在数学、编程、通用逻辑等多项基准测试中表现出色,整体性能已接近 O3 和 Gemini 2.5 Pro 等领先模型。例如,在 AIME 2025 测试中,准确率从之前版本的 70% 提升至 87.5%,平均每道题使用的推理 token 从 12K 增加到 23K,体现了更深的思考过程。此外,新版本还降低了幻觉率,增强了函数调用支持,并优化了 vibe coding 体验。模型最大生成长度为 64K tokens。
GITATTRIBUTESJSONMDPNGSAFETENSORS MIT License 15 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
meituan-longcat/VitaBench 已完整同步
VitaBench是一个用于评估大语言模型代理能力的基准测试,基于真实生活服务场景构建,涵盖外卖、到店消费和在线旅游等领域。该基准集成了66种工具,包含100个跨场景任务和300个单场景任务,要求代理在多轮对话中理解模糊指令、追踪用户意图并灵活调用工具。评估显示,当前最先进的模型在跨场景任务上仅能达到32.5%的成功率,凸显了该基准在推动实用化AI代理发展方面的价值。
GITATTRIBUTESJSONMDPNG MIT License 44 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Open-Orca/OpenOrca 可在线预览 已完整同步
OpenOrca是一个大规模英语数据集,专注于自然语言处理中的指令跟随与对话任务。它包含约100万条由GPT-4生成的完成数据和约320万条由GPT-3.5生成的完成数据,总计约420万条样本。该数据集基于FLAN Collection进行增强,旨在与Orca论文中描述的分布对齐,可用于训练和评估高性能语言模型。其覆盖的任务类型广泛,包括对话、问答、文本分类、摘要、文本生成等。数据集采用MIT许可协议开放,是NLP研究和开发的重要资源。
GITATTRIBUTESMDPARQUETPNG MIT License 3.8 GiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openai/gsm8k 可在线预览 已完整同步
GSM8K(Grade School Math 8K)是一个包含约8500道小学数学应用题的数据集。每个问题都需要2到8步的多步推理,仅涉及基本算术运算(加减乘除),解答以自然语言形式呈现,而非纯数学表达式。该数据集旨在测试语言模型在基础数学推理方面的能力,适合用于文本生成任务。
GITATTRIBUTESMDPARQUETYAML MIT License 5.6 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00