数据集

12 个数据集
已选筛选: JSONL MIT 清除所有筛选
L3 tmp D2 可在线预览 已完整同步
该数据集采用多种格式(bin、csv、jsonl)存储,内容涵盖模型、表格数据和结构化文本,且记录可读,便于灵活调用与分析。
BINCSVJSONL MIT License 149 B 4 个文件 WeHub 同步于 2026-09-03 12:20:44 +00:00
L3 tmp D1 可在线预览 已完整同步
这是一个名为“L3 tmp D1”的数据集,包含二进制、CSV 和 JSONL 三种格式,覆盖模型、表格和结构化文本三类内容。数据集中的记录可读,便于直接使用。
BINCSVJSONL MIT License 124 B 3 个文件 WeHub 同步于 2026-09-03 12:10:49 +00:00
JunkaiZ/Rubrics 可在线预览 已完整同步
该数据集包含用于文本分类的评分标准(rubrics),覆盖健康、通用和金融三个领域。其中健康与通用领域各有5000条训练提示及对应评分标准,并额外提供1000条提示用于端到端胜率对比;金融领域提供1145条训练提示及评分标准。数据以JSONL格式存储,可用于基于评分标准的强化学习奖励建模。
GITATTRIBUTESJSONJSONLMD MIT License 61 MiB 12 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/OctoCodingBench 可在线预览 已完整同步
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
GITATTRIBUTESJSONLMD MIT License 1.0 MiB 4 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
ZJU-REAL/GSM8K-V 可在线预览 已完整同步
GSM8K-V 是一个纯视觉的多图像数学推理基准,旨在将传统文本数学应用题转化为视觉形式。它包含 1,319 个高质量的多场景问题(共 5,343 张图像),覆盖了从现实场景中提取的数学推理任务。该基准可用于评估视觉语言模型在理解图像、跨图像推理以及解决算术问题方面的能力。评测结果表明,即使是当前最强的模型,在视觉数学推理上也与文本任务存在显著差距,凸显了该领域仍有很大的提升空间。
GITATTRIBUTESJSONLMDPNG MIT License 9.8 GiB 5352 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MiniMaxAI/VIBE 可在线预览 已完整同步
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。
GITATTRIBUTESJSONLMDPARQUET MIT License 261 KiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Jiaqi-hkust/Robust-R1 可在线预览 已完整同步
Robust-R1 是一个面向退化感知推理的视觉问答数据集,基于 A-OKVQA 子集构建,包含 1 万条训练样本和 1 千条验证样本,旨在提升模型在复杂视觉退化场景下的鲁棒理解能力。
GITATTRIBUTESJPGJSONLMD MIT License 1.4 GiB 10915 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
DirectionAI/EduBench 可在线预览 已完整同步
EduBench是一个面向教育场景的综合性评估基准数据集,专门用于衡量大语言模型在多样化教学任务中的表现。它覆盖了学生和教师两大视角,共包含十个子任务,如问答、纠错、情感支持、自动出题、评分与教案生成等。数据以JSONL格式提供,每条记录包含任务元信息、输入提示词,以及多个主流大模型的预测结果,便于研究者进行对比分析。
GITATTRIBUTESJSONLMDPNG MIT License 163 MiB 20 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LIFEBench/LIFEBench 可在线预览 已完整同步
LIFEBench是一个专门用于评估大语言模型遵循长度指令能力的综合基准数据集。它包含英文和中文两种语言,覆盖问答、摘要、文本生成等多种任务,长度约束范围从16个单词到8192个单词不等。数据集提供了多个子集(如主集、标签集、精简集和重构集),方便不同场景下的评估。通过分析多个主流模型,该数据集发现大多数模型在短长度指令上表现良好,但超过一定长度后性能急剧下降,揭示了当前大语言模型在长度遵循方面的根本性局限。
GITATTRIBUTESJSONLMDPARQUETPNG MIT License 15 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/DeepSeek-V3.2 可在线预览 已完整同步
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
GITATTRIBUTESJSONJSONLMDPDFPNGPYSAFETENSORSTXT MIT License 441 GiB 192 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
showlab/OmniConsistency 可在线预览 已完整同步
OmniConsistency 是一个大规模的多风格图像翻译数据集,包含了 22 种独特的艺术风格。每种风格都提供了对齐的图像对:原始图像(如照片或线稿)和对应的风格化图像,并附带描述该艺术风格的文本提示。该数据集适用于风格迁移、图像到图像生成、基于提示的条件生成以及一致性学习等任务。
GITATTRIBUTESJSONLMDPARQUETPNGTXT MIT License 7.4 GiB 7861 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00