数据集
46 个数据集
热门分类:
CoreCognition 是一个面向多模态大语言模型的核心知识基准数据集,源于发展认知科学中的12项基本能力。它包含1,423个多模态样本和80个概念挑战问题,涉及对象持久性、空间推理、计数等人类直觉中固有的核心能力,旨在评估模型在基础认知任务上的表现。
这个数据集包含多个AI模型在价值冲突场景下的响应,以及不同评判模型对合规性的评估。数据分为三个主要子集:默认子集提供六个精选的分歧场景,涵盖各模型间的高分歧情况;完整子集包含全部超过41万条场景;评判评估子集则收录了约1.5万条由三个评判模型对部分模型响应做出的合规性判断。每个样本都记录了查询文本、多个模型的响应及其在各价值维度上的立场分数,适合用于分析模型在价值权衡中的表现。
这是一个用于训练推理模型的数据集,包含可验证的数学和编程任务。数据集共有约28.5万条训练样本,每条样本包含问题ID、任务类型、提示文本、验证信息以及一个参考模型的解答率等字段。
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
这是一个用于多条件图形设计生成的大规模高质量数据集,包含约40万个合成样本。每个样本都带有丰富的多条件标注,涵盖主要视觉元素、次要视觉元素(附带空间与语义信息)以及文本元素(如标语或标题的布局信息)。该数据集适用于文本到图像生成等任务。
这是一个大规模、多语言的对话数据集,由13,500多名志愿者众包构建而成。其中包含超过16万条人类编写的助手式对话消息,覆盖35种语言,并附有超过46万条质量评分。数据以对话树形式组织,每条消息包含角色(助手或提示者)、语言、审核结果、标签以及毒性评估等丰富字段,可用于训练和评估对话模型的对齐能力。