数据集

5 个数据集
已选筛选: gitattributes JSONL Apache-2.0 清除所有筛选
这是一个中文数据集,包含约11万条从DeepSeek-R1蒸馏得到的指令-回答对,已整合为可直接用于监督微调(SFT)的格式。数据涵盖数学、考试、STEM及通用领域(如逻辑推理、小红书、知乎等),并保留了模型打分结果(如正确性、无害性、有用性),便于后续筛选。请注意,数据由模型生成,未经严格验证,使用时需自行甄别。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 647 MiB 4 个文件 WeHub 同步于 2026-08-19 14:28:20 +00:00
自我认知微调数据集 可在线预览 已完整同步
这是一个用于自我认知微调的数据集,包含108条中英文对话样本。每条样本都通过可替换的占位符(如模型名称和作者)设计,方便用户自定义和生成专属大模型的自我认知数据。
GITATTRIBUTESJSONJSONLMD Apache License 2.0 29 KiB 4 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
Lk123/InfoSeek 可在线预览 已完整同步
InfoSeek 是一个面向深度研究(Deep Research)任务的合成数据集,旨在解决需要多步推理、层次化分解和证据综合的复杂问题。数据集包含多个子集:完整的检索树结构(52K 样本),记录了从根问题到子问题的逐步展开过程;基于这些树生成的问答对;一个难度更高的 18K 子集,适合用于端到端强化学习;以及 17K 的推理轨迹,可用于监督微调。此外,还提供了一个 300 条的高难度评估集,包含短而可验证的答案,专门用于评估模型在深层搜索问答上的表现。整个数据集遵循 Apache-2.0 许可,语言为英文。
GITATTRIBUTESJSONLMD Apache License 2.0 396 MiB 7 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Qwen/AgentWorldBench 可在线预览 已完整同步
AgentWorldBench是一个评估语言世界模型能力的综合基准,它基于前沿模型在真实环境中执行任务时的轨迹数据构建而成。该基准覆盖了七个领域:API服务器响应、搜索引擎结果、命令行环境、代码编辑环境、Android UI、浏览器DOM以及桌面操作系统。每个评估样本包含多轮交互历史,要求模型根据之前的动作和观察,预测当前环境观察结果。评价维度包括格式、事实性、一致性、真实性和质量,旨在全面检验世界模型在推理、知识和长上下文理解方面的能力。
GITATTRIBUTESJSONLMD Apache License 2.0 245 MiB 9 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00