数据集

26 个数据集
已选筛选: MIT 数据集 清除所有筛选
RUC-DataLab/DataScience-Instruct-500K 可在线预览 已完整同步
该数据集包含约50万条数据科学指令,用于训练能够自主完成数据科学任务的大语言模型。内容覆盖数据准备、分析、建模、可视化和报告生成等完整流程,支持对结构化、半结构化和非结构化数据的研究分析。
GITATTRIBUTESJPGJSONMDPARQUETPNGZIP MIT License 13 GiB 38 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
meituan-longcat/VitaBench 已完整同步
VitaBench是一个用于评估大语言模型代理能力的基准测试,基于真实生活服务场景构建,涵盖外卖、到店消费和在线旅游等领域。该基准集成了66种工具,包含100个跨场景任务和300个单场景任务,要求代理在多轮对话中理解模糊指令、追踪用户意图并灵活调用工具。评估显示,当前最先进的模型在跨场景任务上仅能达到32.5%的成功率,凸显了该基准在推动实用化AI代理发展方面的价值。
GITATTRIBUTESJSONMDPNG MIT License 44 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Open-Orca/OpenOrca 可在线预览 已完整同步
OpenOrca是一个大规模英语数据集,专注于自然语言处理中的指令跟随与对话任务。它包含约100万条由GPT-4生成的完成数据和约320万条由GPT-3.5生成的完成数据,总计约420万条样本。该数据集基于FLAN Collection进行增强,旨在与Orca论文中描述的分布对齐,可用于训练和评估高性能语言模型。其覆盖的任务类型广泛,包括对话、问答、文本分类、摘要、文本生成等。数据集采用MIT许可协议开放,是NLP研究和开发的重要资源。
GITATTRIBUTESMDPARQUETPNG MIT License 3.8 GiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
E-commerce Orders Dataset 2026 | SCRA 可在线预览 已完整同步
该数据集包含30,000条电商订单记录,涵盖客户画像、订单详情、产品信息、定价结构、折扣、支付方式、物流操作、客户互动、评分和利润指标等41个特征,数据完整无缺失。适用于商业智能、客户分析、销售绩效评估及机器学习任务,可支持高价值订单分类、订单金额预测和退货预测等场景。
CSVIPYNB MIT License 7.4 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openai/gsm8k 可在线预览 已完整同步
GSM8K(Grade School Math 8K)是一个包含约8500道小学数学应用题的数据集。每个问题都需要2到8步的多步推理,仅涉及基本算术运算(加减乘除),解答以自然语言形式呈现,而非纯数学表达式。该数据集旨在测试语言模型在基础数学推理方面的能力,适合用于文本生成任务。
GITATTRIBUTESMDPARQUETYAML MIT License 5.6 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00