数据集
2 个数据集
热门分类:
UNO-Bench是一个统一的全模态模型基准测试,旨在评估单模态与全模态(视觉、音频、语言)的理解能力。它包含44种任务类型和5种模态组合,共1250个人工标注的全模态样本和2480个增强的单模态样本。该数据集特别适合中文真实场景,支持多选和创新的多步开放式问题,并借助通用评分模型实现高效自动评估。通过该基准,可以揭示全模态能力在弱模型上的瓶颈效应与强模型上的协同促进规律。
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。