数据集
3 个数据集
热门分类:
UNO-Bench是一个统一的全模态模型基准测试,旨在评估单模态与全模态(视觉、音频、语言)的理解能力。它包含44种任务类型和5种模态组合,共1250个人工标注的全模态样本和2480个增强的单模态样本。该数据集特别适合中文真实场景,支持多选和创新的多步开放式问题,并借助通用评分模型实现高效自动评估。通过该基准,可以揭示全模态能力在弱模型上的瓶颈效应与强模型上的协同促进规律。
BAAI/BGE-VL-Screenshot
已完整同步
BAAI/BGE-VL-Screenshot 是一个面向视觉化信息检索(VisIR)的模型,能将文本、图像、表格、图表等多模态信息统一表示为截图形式,实现跨模态检索。它基于 Qwen2.5-VL-3B-Instruct 构建,采用 sentence-transformers 框架,支持中英文等多种语言,并配套了大规模截图数据集 VIRA 和综合评测基准 MVRB,旨在提升检索模型在处理多模态信息时的表现。
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。