数据集

97 个数据集
已选筛选: Apache-2.0 数据集 清除所有筛选
CASIA-LM/OpenS2S_Datasets 可在线预览 已完整同步
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
0123456GITATTRIBUTESGZJSONLMD Apache License 2.0 70 GiB 19 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cloudcatcher2/VCBench 已完整同步
VCBench 是一个标准化的视觉语言模型评估框架,专注于数学领域的问答任务。该数据集提供了标准评估和 GPT 辅助评估两种方式,帮助用户衡量模型在单选题和自然语言回答上的表现。评估脚本会输出整体准确率以及按问题类型细分的准确率,方便用户深入分析模型能力。
GITATTRIBUTESJSONMDPNG Apache License 2.0 99 MiB 8423 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
yu0226/CipherBank 可在线预览 已完整同步
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。
GITATTRIBUTESJSONLMD Apache License 2.0 944 KiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
VeriWeb 是面向智能体信息检索的可验证长链网页任务基准,用于评估智能体在网页环境中的搜索、证据获取和结果验证能力。
GITATTRIBUTESJSONMDMP4PNG Apache License 2.0 80 GiB 609 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HuiZhang0812/CreatiDesign_dataset 可在线预览 已完整同步
这是一个用于多条件图形设计生成的大规模高质量数据集,包含约40万个合成样本。每个样本都带有丰富的多条件标注,涵盖主要视觉元素、次要视觉元素(附带空间与语义信息)以及文本元素(如标语或标题的布局信息)。该数据集适用于文本到图像生成等任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 162 GiB 52 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenBuddy/R1-0528-Distill 可在线预览 已完整同步
OpenBuddy/R1-0528-Distill 是一个包含多种格式的数据集,主要采用 JSONL 格式,同时包含 Git 属性文件和 Markdown 文档。其内容涵盖结构化文本、纯文本以及二进制数据,适合用于语言模型的蒸馏训练或相关研究。
GITATTRIBUTESJSONLMD Apache License 2.0 384 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PG23/Mobile-R1 可在线预览 已完整同步
Mobile-R1 是一个面向移动端 GUI 代理的中文轨迹数据集,包含从用户指令到完整交互过程的记录。每个样本由应用名称、指令文本、系统提示和一系列操作步骤组成,步骤中保存了对应屏幕截图、模型推理、子任务描述以及具体的执行动作(如点击、滑动、输入、等待等),并标注了屏幕尺寸用于坐标对齐。该数据集可用于训练和评估多模态模型在真实手机界面上的任务理解与操作生成能力。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 7.8 GiB 3927 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xai-org/grok-1 已完整同步
Grok-1 是一个基于 Apache-2.0 许可证开源的文本生成模型,拥有 3140 亿参数。该模型提供了开放权重,适用于多 GPU 环境下的推理。由于参数量巨大,运行需要配备多块 GPU 的机器。
GITATTRIBUTESMD Apache License 2.0 156 GiB 773 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Lk123/InfoSeek 可在线预览 已完整同步
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
GITATTRIBUTESJSONLMD Apache License 2.0 396 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenAssistant/oasst1 可在线预览 已完整同步
这是一个大规模、多语言的对话数据集,由13,500多名志愿者众包构建而成。其中包含超过16万条人类编写的助手式对话消息,覆盖35种语言,并附有超过46万条质量评分。数据以对话树形式组织,每条消息包含角色(助手或提示者)、语言、审核结果、标签以及毒性评估等丰富字段,可用于训练和评估对话模型的对齐能力。
GITATTRIBUTESGZMDPARQUET Apache License 2.0 221 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
GITATTRIBUTESJSONMD Apache License 2.0 236 MiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
m-a-p/FineFineWeb 可在线预览 已完整同步
FineFineWeb 是一个大规模英文网页语料库,专注于细粒度领域的文本分类与生成。该数据集覆盖了航空航天、农学、艺术、计算机科学、经济学、健康、法律等数十个领域,总计超过1万亿 token。通过多次迭代处理,它提供了丰富的结构化文本,适用于文本分类、文本生成和文本到文本生成等多种自然语言处理任务。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 21 TiB 66109 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/AgentWorldBench 可在线预览 已完整同步
AgentWorldBench是一个评估语言世界模型能力的综合基准,它基于前沿模型在真实环境中执行任务时的轨迹数据构建而成。该基准覆盖了七个领域:API服务器响应、搜索引擎结果、命令行环境、代码编辑环境、Android UI、浏览器DOM以及桌面操作系统。每个评估样本包含多轮交互历史,要求模型根据之前的动作和观察,预测当前环境观察结果。评价维度包括格式、事实性、一致性、真实性和质量,旨在全面检验世界模型在推理、知识和长上下文理解方面的能力。
GITATTRIBUTESJSONLMD Apache License 2.0 245 MiB 9 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Congliu/Chinese-DeepSeek-R1-Distill-data-110k 可在线预览 已完整同步
这是一个中文数据集,包含约11万条由DeepSeek-R1模型蒸馏得到的指令数据,涵盖数学、考试、STEM以及通用领域(如逻辑推理、社交问答等)。每条数据包含输入、思考过程、输出和评分字段,适用于文本生成、问答等任务的监督微调。数据集采用Apache-2.0许可。
GITATTRIBUTESJSONLMD Apache License 2.0 645 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00