数据集

2 个数据集
已选筛选: 基准测试 JSONL 数据集 清除所有筛选
MiniMaxAI/VIBE 可在线预览 已完整同步
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。
GITATTRIBUTESJSONLMDPARQUET MIT License 261 KiB 5 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
yu0226/CipherBank 可在线预览 已完整同步
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。
GITATTRIBUTESJSONLMD Apache License 2.0 944 KiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00