数据集

26 个数据集
已选筛选: MIT 数据集 清除所有筛选
social-media-impact-on-mental-health 可在线预览 已完整同步
这个数据集聚焦于青少年心理健康与社交媒体使用之间的关系,包含1200名13至19岁青少年的行为与心理指标。数据涵盖社交媒体使用时长、首选平台、睡眠时长、身体活动水平、学业表现、压力与焦虑程度,以及抑郁状态标签。通过分析这些变量,可以观察到睡眠不足、过度使用社交媒体、高压力焦虑与抑郁倾向之间的关联,同时身体活动似乎对心理健康具有一定保护作用。该数据集适用于探索影响青少年心理健康的多种因素,支持分类、回归或相关性分析等任务。
CSV MIT License 61 KiB 1 个文件 WeHub 同步于 2026-09-12 21:33:41 +00:00
fifa-world-cup-2026-player-performance-dataset 可在线预览 已完整同步
这个数据集收录了2026年世界杯期间球员的详细表现数据,涵盖个人属性、比赛参与记录、进攻与防守统计、传球与射门指标、门将数据、纪律情况以及体能表现等。无论是用于构建球员评分模型、分析比赛走势,还是进行战术评估与可视化展示,都能提供丰富的分析基础。适合体育数据分析、机器学习和足球研究等多种场景。
CSV MIT License 16 MiB 1 个文件 WeHub 同步于 2026-09-12 17:33:21 +00:00
rs-accept http file 已完整同步
该数据集包含用于接受测试的HTTP文件,数据格式为二进制,不可直接读取。内容涉及HTTP文件传输的验证场景。
MIT License 1.2 KiB 1 个文件 WeHub 同步于 2026-09-02 08:28:22 +00:00
Anthropic/hh-rlhf 已完整同步
HH-RLHF数据集包含两类数据:一类是人类偏好数据,用于训练偏好或奖励模型,以支持基于人类反馈的强化学习(RLHF),重点关注助手的帮助性和无害性;另一类是红队测试对话数据,记录了人类与AI的对抗性对话,并附有对对话危害性的标注。这些数据仅供研究使用,不适用于直接训练对话代理,因为可能引发有害行为。数据中可能包含冒犯性或令人不适的内容。
GITATTRIBUTESGZMD MIT License 90 MiB 11 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
UNO-Bench 可在线预览 已完整同步
UNO-Bench是一个统一的全模态模型基准测试,旨在评估单模态与全模态(视觉、音频、语言)的理解能力。它包含44种任务类型和5种模态组合,共1250个人工标注的全模态样本和2480个增强的单模态样本。该数据集特别适合中文真实场景,支持多选和创新的多步开放式问题,并借助通用评分模型实现高效自动评估。通过该基准,可以揭示全模态能力在弱模型上的瓶颈效应与强模型上的协同促进规律。
GITATTRIBUTESJPEGJPGMDMP3MP4PARQUETPDFPNGWAV MIT License 10 GiB 5735 个文件 WeHub 同步于 2026-08-07 02:56:56 +00:00
这是一个包含约9万张合成数字签名图片的数据集,涵盖了30种手写与签名风格的字体。每种字体提供3000张签名样本,图片格式统一为PNG。数据集可用于训练和评估数字签名检测、字体识别以及文档验证等计算机视觉任务,特别适用于识别那些通过键盘输入、模仿真实手写签名的“打字数字签名”。
GITATTRIBUTESMDPNG MIT License 142 MiB 32845 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cais/mmlu 可在线预览 已完整同步
MMLU 是英文多任务语言理解评测集,覆盖抽象代数、法律、医学、计算机科学等多个学科,以多项选择题评估模型的知识与推理能力。
GITATTRIBUTESJSONMDPARQUETPYTAR MIT License 258 MiB 181 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wormtooth/MNBVC-judgment 已完整同步
MNBVC-judgment 是中文裁判文书语料,采用 MNBVC 通用数据格式并以压缩文件提供,适合用于法律文本处理与中文语言模型研究。
GITATTRIBUTESGZMD MIT License 116 GiB 996 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
JunkaiZ/Rubrics 可在线预览 已完整同步
该数据集包含用于文本分类的评分标准(rubrics),覆盖健康、通用和金融三个领域。其中健康与通用领域各有5000条训练提示及对应评分标准,并额外提供1000条提示用于端到端胜率对比;金融领域提供1145条训练提示及评分标准。数据以JSONL格式存储,可用于基于评分标准的强化学习奖励建模。
GITATTRIBUTESJSONJSONLMD MIT License 61 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
AQ-MedAI/GAPS-NSCLC-preview 已完整同步
该数据集是一个专门用于评估AI模型在临床场景中表现的医学数据集,聚焦于胸外科领域的非小细胞肺癌(NSCLC)分期与治疗规划。它包含92个精心设计的临床案例,覆盖术前评估、诊断流程、分期判断、治疗决策及风险分层等关键环节。数据集采用正负分相结合的多维度评分体系,从而对AI的临床决策能力进行量化评估。所有案例均经过多学科临床团队审核,确保专业性和准确性,可用于AI临床决策支持、医学教育及模型性能对比等场景。
GITATTRIBUTESMDXLSX MIT License 508 KiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HydroSophyTech/ToxiMol-benchmark 可在线预览 已完整同步
ToxiMol 是一个专门用于分子毒性修复的基准数据集,包含 660 个具有代表性的有毒分子,覆盖多种毒性机制和不同粒度。它提供了 11 项主要的毒性修复任务,每个任务对应一个特定的毒性终点(如致突变性、致癌性、心脏毒性等)。数据集采用多模态输入,包括 SMILES 字符串和通过 RDKit 渲染的二维分子结构图像,旨在评估多模态大语言模型在结构层面进行分子去毒化时的能力。该基准适用于分类与回归任务,是药物发现和分子设计领域的重要资源。
GITATTRIBUTESJSONMDPARQUET MIT License 20 MiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/OctoCodingBench 可在线预览 已完整同步
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
GITATTRIBUTESJSONLMD MIT License 1.0 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/Janus-Pro-7B 已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
BINGITATTRIBUTESJSONMDPNG MIT License 14 GiB 13 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZJU-REAL/GSM8K-V 可在线预览 已完整同步
GSM8K-V 是一个纯视觉的多图像数学推理基准,旨在将传统文本数学应用题转化为视觉形式。它包含 1,319 个高质量的多场景问题(共 5,343 张图像),覆盖了从现实场景中提取的数学推理任务。该基准可用于评估视觉语言模型在理解图像、跨图像推理以及解决算术问题方面的能力。评测结果表明,即使是当前最强的模型,在视觉数学推理上也与文本任务存在显著差距,凸显了该领域仍有很大的提升空间。
GITATTRIBUTESJSONLMDPNG MIT License 9.8 GiB 5352 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/VIBE 可在线预览 已完整同步
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。
GITATTRIBUTESJSONLMDPARQUET MIT License 261 KiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Jiaqi-hkust/Robust-R1 可在线预览 已完整同步
Robust-R1 是一个面向退化感知推理的视觉问答数据集,基于 A-OKVQA 子集构建,包含 1 万条训练样本和 1 千条验证样本,旨在提升模型在复杂视觉退化场景下的鲁棒理解能力。
GITATTRIBUTESJPGJSONLMD MIT License 1.4 GiB 10915 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DirectionAI/EduBench 可在线预览 已完整同步
EduBench是一个面向教育场景的综合性评估基准数据集,专门用于衡量大语言模型在多样化教学任务中的表现。它覆盖了学生和教师两大视角,共包含十个子任务,如问答、纠错、情感支持、自动出题、评分与教案生成等。数据以JSONL格式提供,每条记录包含任务元信息、输入提示词,以及多个主流大模型的预测结果,便于研究者进行对比分析。
GITATTRIBUTESJSONLMDPNG MIT License 163 MiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LIFEBench/LIFEBench 可在线预览 已完整同步
LIFEBench是一个专门用于评估大语言模型遵循长度指令能力的综合基准数据集。它包含英文和中文两种语言,覆盖问答、摘要、文本生成等多种任务,长度约束范围从16个单词到8192个单词不等。数据集提供了多个子集(如主集、标签集、精简集和重构集),方便不同场景下的评估。通过分析多个主流模型,该数据集发现大多数模型在短长度指令上表现良好,但超过一定长度后性能急剧下降,揭示了当前大语言模型在长度遵循方面的根本性局限。
GITATTRIBUTESJSONLMDPARQUETPNG MIT License 15 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
showlab/OmniConsistency 可在线预览 已完整同步
OmniConsistency 是一个大规模的多风格图像翻译数据集,包含了 22 种独特的艺术风格。每种风格都提供了对齐的图像对:原始图像(如照片或线稿)和对应的风格化图像,并附带描述该艺术风格的文本提示。该数据集适用于风格迁移、图像到图像生成、基于提示的条件生成以及一致性学习等任务。
GITATTRIBUTESJSONLMDPARQUETPNGTXT MIT License 7.4 GiB 7861 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00