数据集

12 个数据集
已选筛选: md 清除所有筛选
fka/prompts.chat 可在线预览 已完整同步
这是一个由社区贡献的AI提示词(prompts)数据集,包含大量用户分享的各类对话提示,适用于ChatGPT、Claude、Gemini、Llama、Mistral等主流AI聊天模型。数据覆盖问答和文本生成任务,规模在10万到100万条之间,提供CSV等格式,方便直接使用和分析。
CSVGITATTRIBUTESMD CC0 1.0 Universal 5.5 MiB 3 个文件 WeHub 同步于 2026-09-07 07:03:50 +00:00
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 3.8 MiB 8 个文件 WeHub 同步于 2026-08-29 21:03:42 +00:00
商品评论情感预测 可在线预览 已完整同步
该数据集包含从2011年到2014年某电商平台的海量消费者行为数据,涵盖52万件商品、1100多个类目、142万用户及720万条评论与评分。每条评论均包含评论标题、评论内容以及1-5分的评分,可用于训练商品评论情感预测模型。数据集还提供了商品信息、商品类别列表等辅助文件,便于进行细粒度的分析与建模。
CSVJSONMD Apache License 2.0 5.6 MiB 4 个文件 WeHub 同步于 2026-08-20 15:34:55 +00:00
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
GITATTRIBUTESJSONMDMVNPNGPTWAVYAML Apache License 2.0 868 MiB 11 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
IndustryCorpus2 是一个覆盖 30 余个行业类别的高质量预训练数据集,包含中文约 1TB、英文约 2.2TB 的文本数据。数据经过规则与模型双重语义质量筛选,并根据质量评估分数划分为高、中、低三个层级,以适配不同场景的模型训练需求。行业分类结合了国民经济行业分类与世界知识体系,涵盖编程、生物医药、法律、金融、数学统计、交通运输、航空航天、制造业等主流领域,旨在为行业大模型提供专业、大规模且高质量的训练语料。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.7 TiB 3206 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
Fineweb-Edu-Chinese-V2.1 已完整同步
Fineweb-Edu-Chinese-V2.1 是一个面向中文教育领域的大规模文本生成数据集。它包含按质量评分分档整理的内容,评分范围从 2 到 5,其中 4-5 分为高质量教育文本(约 70GB,460 亿 token),3-4 分为较适用的内容(约 800GB,5300 亿 token),2-3 分则为潜在可用但质量有限的数据(约 1.4TB,9300 亿 token)。数据集以文件夹形式组织,便于用户根据训练时间和计算资源灵活选择不同质量档位的数据,适用于各类语言模型的训练与微调。
GITATTRIBUTESMDPDF Apache License 2.0 192 KiB 3 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
sarosavo/Master-RM 已完整同步
这是一个用于训练鲁棒生成式奖励模型(Master-RM)的合成数据集,包含约18万条训练样本。每条样本由问题、回答和二元偏好标签组成,适用于监督微调、偏好优化等任务。数据集特别针对生成式奖励模型容易被表面操作(如无意义符号或推理开头)欺骗的漏洞进行了增强,通过额外添加2万个负例样本,帮助模型提升抵抗这类攻击的鲁棒性。
GITATTRIBUTESJSONMD Apache License 2.0 310 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/OctoCodingBench 可在线预览 已完整同步
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
GITATTRIBUTESJSONLMD MIT License 1.0 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Lk123/InfoSeek 可在线预览 已完整同步
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
GITATTRIBUTESJSONLMD Apache License 2.0 396 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
meituan-longcat/VitaBench 已完整同步
VitaBench是一个用于评估大语言模型代理能力的基准测试,基于真实生活服务场景构建,涵盖外卖、到店消费和在线旅游等领域。该基准集成了66种工具,包含100个跨场景任务和300个单场景任务,要求代理在多轮对话中理解模糊指令、追踪用户意图并灵活调用工具。评估显示,当前最先进的模型在跨场景任务上仅能达到32.5%的成功率,凸显了该基准在推动实用化AI代理发展方面的价值。
GITATTRIBUTESJSONMDPNG MIT License 44 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/AgentWorldBench 可在线预览 已完整同步
AgentWorldBench是一个评估语言世界模型能力的综合基准,它基于前沿模型在真实环境中执行任务时的轨迹数据构建而成。该基准覆盖了七个领域:API服务器响应、搜索引擎结果、命令行环境、代码编辑环境、Android UI、浏览器DOM以及桌面操作系统。每个评估样本包含多轮交互历史,要求模型根据之前的动作和观察,预测当前环境观察结果。评价维度包括格式、事实性、一致性、真实性和质量,旨在全面检验世界模型在推理、知识和长上下文理解方面的能力。
GITATTRIBUTESJSONLMD Apache License 2.0 245 MiB 9 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00