数据集
2 个数据集
热门分类:
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
LIFEBench是一个专门用于评估大语言模型遵循长度指令能力的综合基准数据集。它包含英文和中文两种语言,覆盖问答、摘要、文本生成等多种任务,长度约束范围从16个单词到8192个单词不等。数据集提供了多个子集(如主集、标签集、精简集和重构集),方便不同场景下的评估。通过分析多个主流模型,该数据集发现大多数模型在短长度指令上表现良好,但超过一定长度后性能急剧下降,揭示了当前大语言模型在长度遵循方面的根本性局限。