数据集

166 个数据集
已选筛选: 数据集 清除所有筛选
VeriWeb 是面向智能体信息检索的可验证长链网页任务基准,用于评估智能体在网页环境中的搜索、证据获取和结果验证能力。
GITATTRIBUTESJSONMDMP4PNG Apache License 2.0 80 GiB 609 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HuiZhang0812/CreatiDesign_dataset 可在线预览 已完整同步
这是一个用于多条件图形设计生成的大规模高质量数据集,包含约40万个合成样本。每个样本都带有丰富的多条件标注,涵盖主要视觉元素、次要视觉元素(附带空间与语义信息)以及文本元素(如标语或标题的布局信息)。该数据集适用于文本到图像生成等任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 162 GiB 52 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
showlab/OmniConsistency 可在线预览 已完整同步
OmniConsistency 是一个大规模的多风格图像翻译数据集,包含了 22 种独特的艺术风格。每种风格都提供了对齐的图像对:原始图像(如照片或线稿)和对应的风格化图像,并附带描述该艺术风格的文本提示。该数据集适用于风格迁移、图像到图像生成、基于提示的条件生成以及一致性学习等任务。
GITATTRIBUTESJSONLMDPARQUETPNGTXT MIT License 7.4 GiB 7861 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenBuddy/R1-0528-Distill 可在线预览 已完整同步
OpenBuddy/R1-0528-Distill 是一个包含多种格式的数据集,主要采用 JSONL 格式,同时包含 Git 属性文件和 Markdown 文档。其内容涵盖结构化文本、纯文本以及二进制数据,适合用于语言模型的蒸馏训练或相关研究。
GITATTRIBUTESJSONLMD Apache License 2.0 384 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PG23/Mobile-R1 可在线预览 已完整同步
Mobile-R1 是一个面向移动端 GUI 代理的中文轨迹数据集,包含从用户指令到完整交互过程的记录。每个样本由应用名称、指令文本、系统提示和一系列操作步骤组成,步骤中保存了对应屏幕截图、模型推理、子任务描述以及具体的执行动作(如点击、滑动、输入、等待等),并标注了屏幕尺寸用于坐标对齐。该数据集可用于训练和评估多模态模型在真实手机界面上的任务理解与操作生成能力。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 7.8 GiB 3927 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xai-org/grok-1 已完整同步
Grok-1 是一个基于 Apache-2.0 许可证开源的文本生成模型,拥有 3140 亿参数。该模型提供了开放权重,适用于多 GPU 环境下的推理。由于参数量巨大,运行需要配备多块 GPU 的机器。
GITATTRIBUTESMD Apache License 2.0 156 GiB 773 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Lk123/InfoSeek 可在线预览 已完整同步
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
GITATTRIBUTESJSONLMD Apache License 2.0 396 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RUC-DataLab/DataScience-Instruct-500K 可在线预览 已完整同步
该数据集包含约50万条数据科学指令,用于训练能够自主完成数据科学任务的大语言模型。内容覆盖数据准备、分析、建模、可视化和报告生成等完整流程,支持对结构化、半结构化和非结构化数据的研究分析。
GITATTRIBUTESJPGJSONMDPARQUETPNGZIP MIT License 13 GiB 38 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
meituan-longcat/VitaBench 已完整同步
VitaBench是一个用于评估大语言模型代理能力的基准测试,基于真实生活服务场景构建,涵盖外卖、到店消费和在线旅游等领域。该基准集成了66种工具,包含100个跨场景任务和300个单场景任务,要求代理在多轮对话中理解模糊指令、追踪用户意图并灵活调用工具。评估显示,当前最先进的模型在跨场景任务上仅能达到32.5%的成功率,凸显了该基准在推动实用化AI代理发展方面的价值。
GITATTRIBUTESJSONMDPNG MIT License 44 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenAssistant/oasst1 可在线预览 已完整同步
这是一个大规模、多语言的对话数据集,由13,500多名志愿者众包构建而成。其中包含超过16万条人类编写的助手式对话消息,覆盖35种语言,并附有超过46万条质量评分。数据以对话树形式组织,每条消息包含角色(助手或提示者)、语言、审核结果、标签以及毒性评估等丰富字段,可用于训练和评估对话模型的对齐能力。
GITATTRIBUTESGZMDPARQUET Apache License 2.0 221 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Open-Orca/OpenOrca 可在线预览 已完整同步
OpenOrca是一个大规模英语数据集,专注于自然语言处理中的指令跟随与对话任务。它包含约100万条由GPT-4生成的完成数据和约320万条由GPT-3.5生成的完成数据,总计约420万条样本。该数据集基于FLAN Collection进行增强,旨在与Orca论文中描述的分布对齐,可用于训练和评估高性能语言模型。其覆盖的任务类型广泛,包括对话、问答、文本分类、摘要、文本生成等。数据集采用MIT许可协议开放,是NLP研究和开发的重要资源。
GITATTRIBUTESMDPARQUETPNG MIT License 3.8 GiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
GITATTRIBUTESJSONMD Apache License 2.0 236 MiB 6 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
E-commerce Orders Dataset 2026 | SCRA 可在线预览 已完整同步
该数据集包含30,000条电商订单记录,涵盖客户画像、订单详情、产品信息、定价结构、折扣、支付方式、物流操作、客户互动、评分和利润指标等41个特征,数据完整无缺失。适用于商业智能、客户分析、销售绩效评估及机器学习任务,可支持高价值订单分类、订单金额预测和退货预测等场景。
CSVIPYNB MIT License 7.4 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个面向量化研究和市场分析的金融市场历史行情数据集,包含日线与分钟级别的行情数据,支持通过 API 查询或直接读取 JSON 格式文件来获取结构化历史数据。
JSON cc-by-4.0 23 GiB 12147 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
mito0o852/OHLCV-1m 可在线预览 已完整同步
该数据集包含多个股票代码的1分钟级别OHLCV(开盘价、最高价、最低价、收盘价、成交量)数据,所有时间戳均以UTC时区记录。数据集中有一个主要的训练集,以及众多以股票代码命名的独立分片,每个分片对应特定股票的历史行情。整体样本量较大,适合用于金融时间序列分析、量化交易策略回测等场景。
GITATTRIBUTESMDPARQUET cc-by-4.0 82 GiB 413 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
热搜榜单最新快照 已完整同步
热搜榜单最新快照是多个平台热搜榜单的当前采集结果,使用 JSON 保存榜单名称、条目、热度和采集时间等信息。
JSON cc-by-4.0 2.0 MiB 59 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
热搜榜单历史快照 已完整同步
热搜榜单历史快照是多个平台热搜榜单的历史时间序列,使用 JSON 保存不同采集时刻的榜单条目和热度信息。
JSON cc-by-4.0 282 MiB 315 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00