数据集
1 个数据集
热门分类:
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。