数据集
2 个数据集
热门分类:
该数据集包含约50万条数据科学指令,用于训练能够自主完成数据科学任务的大语言模型。内容覆盖数据准备、分析、建模、可视化和报告生成等完整流程,支持对结构化、半结构化和非结构化数据的研究分析。
VitaBench是一个用于评估大语言模型代理能力的基准测试,基于真实生活服务场景构建,涵盖外卖、到店消费和在线旅游等领域。该基准集成了66种工具,包含100个跨场景任务和300个单场景任务,要求代理在多轮对话中理解模糊指令、追踪用户意图并灵活调用工具。评估显示,当前最先进的模型在跨场景任务上仅能达到32.5%的成功率,凸显了该基准在推动实用化AI代理发展方面的价值。