数据集

166 个数据集
已选筛选: 数据集 清除所有筛选
thu-pacman/PCMind-2.1-Kaiyuan-2B 可在线预览 已完整同步
这个数据集是为PCMind-v2.1-Kaiyuan-2B语言模型提供的完整预训练数据集,总规模超过1TB。它包含5个训练阶段,覆盖英语、中文、代码、数学和SFT五大领域,并采用领域特定的混合策略和两种采样方式(前两阶段均匀采样,后三阶段基于课程学习排序)。数据以文本形式呈现,支持中英文,适用于文本生成任务。
GITATTRIBUTESMDPARQUET Apache License 2.0 2.8 TiB 660 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
AQ-MedAI/GAPS-NSCLC-preview 已完整同步
该数据集是一个专门用于评估AI模型在临床场景中表现的医学数据集,聚焦于胸外科领域的非小细胞肺癌(NSCLC)分期与治疗规划。它包含92个精心设计的临床案例,覆盖术前评估、诊断流程、分期判断、治疗决策及风险分层等关键环节。数据集采用正负分相结合的多维度评分体系,从而对AI的临床决策能力进行量化评估。所有案例均经过多学科临床团队审核,确保专业性和准确性,可用于AI临床决策支持、医学教育及模型性能对比等场景。
GITATTRIBUTESMDXLSX MIT License 508 KiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HydroSophyTech/ToxiMol-benchmark 可在线预览 已完整同步
ToxiMol 是一个专门用于分子毒性修复的基准数据集,包含 660 个具有代表性的有毒分子,覆盖多种毒性机制和不同粒度。它提供了 11 项主要的毒性修复任务,每个任务对应一个特定的毒性终点(如致突变性、致癌性、心脏毒性等)。数据集采用多模态输入,包括 SMILES 字符串和通过 RDKit 渲染的二维分子结构图像,旨在评估多模态大语言模型在结构层面进行分子去毒化时的能力。该基准适用于分类与回归任务,是药物发现和分子设计领域的重要资源。
GITATTRIBUTESJSONMDPARQUET MIT License 20 MiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/OctoCodingBench 可在线预览 已完整同步
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
GITATTRIBUTESJSONLMD MIT License 1.0 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/Janus-Pro-7B 已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
BINGITATTRIBUTESJSONMDPNG MIT License 14 GiB 13 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
IWR-Bench/IWR-Bench 可在线预览 已完整同步
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
BMPGIFGITATTRIBUTESJPGJSONLMDMP4PNGPYSVGWEBP Apache License 2.0 2.5 GiB 9779 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZJU-REAL/GSM8K-V 可在线预览 已完整同步
GSM8K-V 是一个纯视觉的多图像数学推理基准,旨在将传统文本数学应用题转化为视觉形式。它包含 1,319 个高质量的多场景问题(共 5,343 张图像),覆盖了从现实场景中提取的数学推理任务。该基准可用于评估视觉语言模型在理解图像、跨图像推理以及解决算术问题方面的能力。评测结果表明,即使是当前最强的模型,在视觉数学推理上也与文本任务存在显著差距,凸显了该领域仍有很大的提升空间。
GITATTRIBUTESJSONLMDPNG MIT License 9.8 GiB 5352 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/VIBE 可在线预览 已完整同步
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。
GITATTRIBUTESJSONLMDPARQUET MIT License 261 KiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Jiaqi-hkust/Robust-R1 可在线预览 已完整同步
Robust-R1 是一个面向退化感知推理的视觉问答数据集,基于 A-OKVQA 子集构建,包含 1 万条训练样本和 1 千条验证样本,旨在提升模型在复杂视觉退化场景下的鲁棒理解能力。
GITATTRIBUTESJPGJSONLMD MIT License 1.4 GiB 10915 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
williamium/CoreCognition 可在线预览 已完整同步
CoreCognition 是一个面向多模态大语言模型的核心知识基准数据集,源于发展认知科学中的12项基本能力。它包含1,423个多模态样本和80个概念挑战问题,涉及对象持久性、空间推理、计数等人类直觉中固有的核心能力,旨在评估模型在基础认知任务上的表现。
GITATTRIBUTESJPGMDPARQUETZIP Apache License 2.0 8.1 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
jifanz/stress_testing_model_spec 可在线预览 已完整同步
这个数据集包含多个AI模型在价值冲突场景下的响应,以及不同评判模型对合规性的评估。数据分为三个主要子集:默认子集提供六个精选的分歧场景,涵盖各模型间的高分歧情况;完整子集包含全部超过41万条场景;评判评估子集则收录了约1.5万条由三个评判模型对部分模型响应做出的合规性判断。每个样本都记录了查询文本、多个模型的响应及其在各价值维度上的立场分数,适合用于分析模型在价值权衡中的表现。
GITATTRIBUTESMDPARQUET Apache License 2.0 12 GiB 85 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DirectionAI/EduBench 可在线预览 已完整同步
EduBench是一个面向教育场景的综合性评估基准数据集,专门用于衡量大语言模型在多样化教学任务中的表现。它覆盖了学生和教师两大视角,共包含十个子任务,如问答、纠错、情感支持、自动出题、评分与教案生成等。数据以JSONL格式提供,每条记录包含任务元信息、输入提示词,以及多个主流大模型的预测结果,便于研究者进行对比分析。
GITATTRIBUTESJSONLMDPNG MIT License 163 MiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PrimeIntellect/INTELLECT-2-RL-Dataset 可在线预览 已完整同步
这是一个用于训练推理模型的数据集,包含可验证的数学和编程任务。数据集共有约28.5万条训练样本,每条样本包含问题ID、任务类型、提示文本、验证信息以及一个参考模型的解答率等字段。
GITATTRIBUTESMDPARQUET Apache License 2.0 1.6 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个基于 Qwen3-30B-A3B 的 GGUF 格式量化模型,支持 128K 上下文长度,采用 Unsloth Dynamic 2.0 量化技术,在保持较高精度的同时优化了运行效率。该模型可在 llama.cpp、Ollama 等框架中直接使用,并支持通过 `/think` 和 `/no_think` 指令在推理过程中切换模型的思考模式,方便多轮对话中的灵活控制。
DATGGUFGITATTRIBUTESJSONMD Apache License 2.0 395 GiB 33 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Time-HD-Anonymous/High_Dimensional_Time_Series 可在线预览 已完整同步
High_Dimensional_Time_Series 是多变量时间序列预测数据集,包含 M5、伦敦智能电表、Wikipedia 流量、全球温度和风速等序列配置。
CSVGITATTRIBUTESMD Apache License 2.0 16 GiB 30 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
CASIA-LM/OpenS2S_Datasets 可在线预览 已完整同步
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
0123456GITATTRIBUTESGZJSONLMD Apache License 2.0 70 GiB 19 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cloudcatcher2/VCBench 已完整同步
VCBench 是一个标准化的视觉语言模型评估框架,专注于数学领域的问答任务。该数据集提供了标准评估和 GPT 辅助评估两种方式,帮助用户衡量模型在单选题和自然语言回答上的表现。评估脚本会输出整体准确率以及按问题类型细分的准确率,方便用户深入分析模型能力。
GITATTRIBUTESJSONMDPNG Apache License 2.0 99 MiB 8423 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LIFEBench/LIFEBench 可在线预览 已完整同步
LIFEBench是一个专门用于评估大语言模型遵循长度指令能力的综合基准数据集。它包含英文和中文两种语言,覆盖问答、摘要、文本生成等多种任务,长度约束范围从16个单词到8192个单词不等。数据集提供了多个子集(如主集、标签集、精简集和重构集),方便不同场景下的评估。通过分析多个主流模型,该数据集发现大多数模型在短长度指令上表现良好,但超过一定长度后性能急剧下降,揭示了当前大语言模型在长度遵循方面的根本性局限。
GITATTRIBUTESJSONLMDPARQUETPNG MIT License 15 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
yu0226/CipherBank 可在线预览 已完整同步
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。
GITATTRIBUTESJSONLMD Apache License 2.0 944 KiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00