数据集
168 个数据集
热门分类:
jetmoe/jetmoe-8b
已完整同步
JetMoE-8B 是一个高效的大语言模型,仅需极低的训练成本就能达到甚至超越 LLaMA2-7B 的性能。它在推理时只有 2.2B 活跃参数,大幅降低了计算开销,同时优于计算量相近的模型(如 Gemma-2B)。该模型完全基于公开数据集训练,代码开源,便于在普通消费级 GPU 上进行微调,适合学术研究场景。
VitaBench是一个用于评估大语言模型代理能力的基准测试,基于真实生活服务场景构建,涵盖外卖、到店消费和在线旅游等领域。该基准集成了66种工具,包含100个跨场景任务和300个单场景任务,要求代理在多轮对话中理解模糊指令、追踪用户意图并灵活调用工具。评估显示,当前最先进的模型在跨场景任务上仅能达到32.5%的成功率,凸显了该基准在推动实用化AI代理发展方面的价值。
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
金融市场历史行情数据集
已完整同步
这是一个面向量化研究和市场分析的金融市场历史行情数据集,包含日线与分钟级别的行情数据,支持通过 API 查询或直接读取 JSON 格式文件来获取结构化历史数据。
热搜榜单最新快照
已完整同步
热搜榜单最新快照是多个平台热搜榜单的当前采集结果,使用 JSON 保存榜单名称、条目、热度和采集时间等信息。
热搜榜单历史快照
已完整同步
热搜榜单历史快照是多个平台热搜榜单的历史时间序列,使用 JSON 保存不同采集时刻的榜单条目和热度信息。
小红书创作者笔记
已完整同步
小红书创作者笔记数据集包含创作者发布的帖子、帖子详情和评论等结构化内容,适合研究内容主题、互动和创作者生态。
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。