数据集
71 个数据集
热门分类:
该数据集采用多种格式(bin、csv、jsonl)存储,内容涵盖模型、表格数据和结构化文本,且记录可读,便于灵活调用与分析。
这是一个名为“L3 tmp D1”的数据集,包含二进制、CSV 和 JSONL 三种格式,覆盖模型、表格和结构化文本三类内容。数据集中的记录可读,便于直接使用。
该数据集聚焦于机器人操作任务,包含在家庭场景中使用机械臂拾取纸板箱并放入纸箱的完整过程。数据涵盖402个操作片段、约18.8万帧,提供8个相机视角的视频及状态、动作数据。附有精细的子任务分割、场景描述、末端执行器方向和速度等注释,支持机器人学习与操作技能研究。
魔搭通用SFT数据集是MSAgent-Bench的一个子集,主要涵盖通用问答场景下的监督微调(SFT)数据。每条样本包含一个唯一标识符和对话内容,对话由system、user、assistant三种角色组成,system用于设定模型前置人设,user为用户的输入,assistant为模型的回复。该数据集适用于工具学习、API调用等任务场景,有助于提升模型在复杂交互中的表现。
这个数据集包含约11万条中文对话样本,每条数据由用户提问和模型回答组成,内容涵盖广泛的知识与推理场景。数据基于高性能大语言模型生成,旨在用于微调时作为通用数据集混合,帮助模型保持知识广度、避免遗忘。
该数据集包含约14.5万条价值观比较样本,每条样本由问题(prompt)、正例回复和负例回复组成,并标注了回复的类型(如“拒绝为主”或“风险回复”)。数据集可用于大模型安全与价值观对齐的相关研究,例如通过正例增强模型安全性、利用正反例训练奖励模型,或构造多项选择题来评估模型表现。数据采用JSONL格式,分为训练和测试两部分。
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。
匠数科技大模型SFT数据集是一个经过精心整理和严格审核的高质量中文及英文数据集,专为大型语言模型的监督微调(SFT)任务设计。该数据集汇总了众多开源数据,经过格式统一、清洗和内容安全筛查,最终包含超过12M条样本,并按任务类型划分为50个类别,每条样本均包含指令、输入、输出、历史对话等结构化字段,方便用户直接用于训练和评估。数据集覆盖广泛的中文任务,同时英文数据也经过单独整理,兼顾了跨语言翻译等场景,为SFT研究提供了安全、统一、易用的资源。
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
Matrix 是面向大语言模型预训练的中英文大规模语料资源,包含多个来源和处理阶段,规模约为数万亿 token。
这是一个为训练Llama3中文模型而整合的多源指令微调数据集。它融合了英文通用指令、中文知乎问答、ShareGPT对话、中文常识任务、成语、诗词、逻辑推理、小红书风格文本等多种数据,并统一处理为firefly格式,便于直接训练。数据集包含约169万条清洗后的问答对,支持按需选择子集或合并使用,适合用于提升模型的中文理解和生成能力。
该数据集主要用于LaTeX OCR(光学字符识别)测试,包含图片(PNG格式)以及对应的标注文件(JSON、JSONL等),可用于训练或评估将LaTeX公式图像转换为可编辑文本的模型。
这是一个中文数据集,包含约11万条从DeepSeek-R1蒸馏得到的指令-回答对,已整合为可直接用于监督微调(SFT)的格式。数据涵盖数学、考试、STEM及通用领域(如逻辑推理、小红书、知乎等),并保留了模型打分结果(如正确性、无害性、有用性),便于后续筛选。请注意,数据由模型生成,未经严格验证,使用时需自行甄别。
这是一个用于自我认知微调的数据集,包含108条中英文对话样本。每条样本都通过可替换的占位符(如模型名称和作者)设计,方便用户自定义和生成专属大模型的自我认知数据。
这是一个用于机器人食品包装任务的协作机器人数据集,基于LeRobot扩展格式。数据由配备两指夹爪的AgileX Cobot机器人采集,在厨房场景中执行抓取、拉、放置、拾取等原子动作。数据集包含798个演示片段,总帧数约147万,涵盖两个主要任务:将午餐盒、黄瓜和梨放入小包装袋,以及将午餐盒、香蕉和面包放入大包装袋,并进一步细分为49个子任务。数据以视频、parquet和JSONL等格式提供,支持中英文描述,适用于机器人模仿学习等研究。
这是一个面向机器人操作任务的精细动作数据集,包含648个完整演示片段,总帧数约36.6万,每秒30帧,数据量约4GB。数据集以试管放置为核心任务,涵盖抓取、放置、传递、移动等多种原子动作,并细分为12个子任务。场景覆盖学校与医院两类环境,配备3个相机视角,且提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的方向、速度、加速度以及夹爪状态等,适合用于机器人模仿学习、动作规划等研究。
这是一个基于 LeRobot 扩展格式的机器人操作数据集,包含 714 个片段(约 41 万帧),记录了在厨房和餐厅场景中,机器人使用两指夹爪完成“倒米”任务的操作过程。任务要求机器人用一只手将碗放至桌子中央,另一只手将米杯中的米倒入碗中,涉及抓取、拾取、放置和倒米等原子动作。数据集包含 3 个视角的视频,并提供了丰富的标注,如子任务分割、场景描述、末端执行器的运动方向/速度/加速度,以及夹爪开合状态等,便于用于机器人学习研究。
这是一个用于机器人操作的数据集,聚焦于“倒米”任务,包含740个演示片段,共计约50万帧,以30帧/秒的速率记录。机器人采用双臂构型,配备两个二指夹爪,在居家和厨房场景中执行抓取、放置、倾倒等原子动作。数据集提供了丰富的标注信息,包括子任务分割、场景描述、末端执行器的运动方向与速度、夹爪开合状态等,还包含3个相机视角的同步视频,可用于模仿学习、行为克隆等研究。