数据集

71 个数据集
已选筛选: JSONL 清除所有筛选
deepseek-ai/DeepSeek-V3.2 可在线预览 已完整同步
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
GITATTRIBUTESJSONJSONLMDPDFPNGPYSAFETENSORSTXT MIT License 441 GiB 192 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
showlab/OmniConsistency 可在线预览 已完整同步
OmniConsistency 是一个大规模的多风格图像翻译数据集,包含了 22 种独特的艺术风格。每种风格都提供了对齐的图像对:原始图像(如照片或线稿)和对应的风格化图像,并附带描述该艺术风格的文本提示。该数据集适用于风格迁移、图像到图像生成、基于提示的条件生成以及一致性学习等任务。
GITATTRIBUTESJSONLMDPARQUETPNGTXT MIT License 7.4 GiB 7861 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenBuddy/R1-0528-Distill 可在线预览 已完整同步
OpenBuddy/R1-0528-Distill 是一个包含多种格式的数据集,主要采用 JSONL 格式,同时包含 Git 属性文件和 Markdown 文档。其内容涵盖结构化文本、纯文本以及二进制数据,适合用于语言模型的蒸馏训练或相关研究。
GITATTRIBUTESJSONLMD Apache License 2.0 384 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PG23/Mobile-R1 可在线预览 已完整同步
Mobile-R1 是一个面向移动端 GUI 代理的中文轨迹数据集,包含从用户指令到完整交互过程的记录。每个样本由应用名称、指令文本、系统提示和一系列操作步骤组成,步骤中保存了对应屏幕截图、模型推理、子任务描述以及具体的执行动作(如点击、滑动、输入、等待等),并标注了屏幕尺寸用于坐标对齐。该数据集可用于训练和评估多模态模型在真实手机界面上的任务理解与操作生成能力。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 7.8 GiB 3927 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Lk123/InfoSeek 可在线预览 已完整同步
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
GITATTRIBUTESJSONLMD Apache License 2.0 396 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
m-a-p/FineFineWeb 可在线预览 已完整同步
FineFineWeb 是一个大规模英文网页语料库,专注于细粒度领域的文本分类与生成。该数据集覆盖了航空航天、农学、艺术、计算机科学、经济学、健康、法律等数十个领域,总计超过1万亿 token。通过多次迭代处理,它提供了丰富的结构化文本,适用于文本分类、文本生成和文本到文本生成等多种自然语言处理任务。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 21 TiB 66109 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/AgentWorldBench 可在线预览 已完整同步
AgentWorldBench是一个评估语言世界模型能力的综合基准,它基于前沿模型在真实环境中执行任务时的轨迹数据构建而成。该基准覆盖了七个领域:API服务器响应、搜索引擎结果、命令行环境、代码编辑环境、Android UI、浏览器DOM以及桌面操作系统。每个评估样本包含多轮交互历史,要求模型根据之前的动作和观察,预测当前环境观察结果。评价维度包括格式、事实性、一致性、真实性和质量,旨在全面检验世界模型在推理、知识和长上下文理解方面的能力。
GITATTRIBUTESJSONLMD Apache License 2.0 245 MiB 9 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Congliu/Chinese-DeepSeek-R1-Distill-data-110k 可在线预览 已完整同步
这是一个中文数据集,包含约11万条由DeepSeek-R1模型蒸馏得到的指令数据,涵盖数学、考试、STEM以及通用领域(如逻辑推理、社交问答等)。每条数据包含输入、思考过程、输出和评分字段,适用于文本生成、问答等任务的监督微调。数据集采用Apache-2.0许可。
GITATTRIBUTESJSONLMD Apache License 2.0 645 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
小红书创作者帖子与评论数据集 可在线预览 已完整同步
这个数据集包含了创作者主页上的帖子详情、列表信息以及相关评论。数据已按帖子ID和评论ID进行去重处理,每条记录以JSONL格式存储,为结构化文本,便于直接阅读和使用。
JSONL unknown 11 MiB 2 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00