数据集
206 个数据集
热门分类:
RoboMIND2.0-Agilex
已完整同步
RoboMIND2.0-Agilex 是一个以 Apache License 2.0 许可协议发布的数据集,包含 hdf5、txt 等多种格式的文件,适用于机器人相关领域的研究与应用。
匠数科技大模型SFT数据集是一个经过精心整理和严格审核的高质量中文及英文数据集,专为大型语言模型的监督微调(SFT)任务设计。该数据集汇总了众多开源数据,经过格式统一、清洗和内容安全筛查,最终包含超过12M条样本,并按任务类型划分为50个类别,每条样本均包含指令、输入、输出、历史对话等结构化字段,方便用户直接用于训练和评估。数据集覆盖广泛的中文任务,同时英文数据也经过单独整理,兼顾了跨语言翻译等场景,为SFT研究提供了安全、统一、易用的资源。
modelscope/mmlu
已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
这是一个基于CT-Transformer架构的中文标点预测模型,适用于语音识别结果的后处理或纯文本输入的标点添加。它通过可控时延技术,在保持模型性能的同时有效降低了标点预测的延迟,能够在通用中文场景下输出具有可读性的文本。
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。
该数据集是 RoboMIND2.0 框架下 Franka 机器人相关数据的第五部分,采用 Apache 2.0 许可证,包含 HDF5、文本文件等多种格式,适用于机器人操作与学习研究。
RoboMIND2.0-UR5
已完整同步
RoboMIND2.0-UR5 是面向 UR5 机械臂操作任务的数据分片,包含 HDF5 数据与文本说明,共 54,592 个文件、约 15.58 TB,适合运动规划、模仿学习和仿真研究。
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
PaddleOCR-VL_demo 是 OCR 与视觉语言模型演示资源,包含图像文件及配套说明,用于展示文档文字识别和视觉理解流程。
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。
这是RoboMIND2.0数据集中的Franka机器人部分第四部分,包含HDF5、文本等多种格式的文件,适用于机器人学习相关任务。该数据集采用Apache License 2.0许可协议。
funasr-demo
已完整同步
funasr-demo 是语音识别演示/测试资源,包含 WAV 音频、SCP/TXT/JSON 标注和说明文件,共 37 个文件、约 5.1 MB,适合 ASR 流程验证。
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
MNN LLM APP 配置
已完整同步
MNN LLM APP 配置是 MNN 大模型应用配置资源,包含 JSON 配置、Markdown 说明和 Git 属性文件,共 3 个文件、约 4.5 KB,适合配置检查而非训练语料。
RoboMIND2.0-Franka-Part-2 是 Franka 机械臂操作数据分片,包含 HDF5 二进制数据与文本说明,共 22,047 个文件、约 9.81 TB,适合操作技能学习与行为仿真。
心理咨询师数字孪生对话数据集
已完整同步
该数据集包含多轮心理咨询对话,用于构建心理咨询师的数字孪生模型。数据基于少量真实咨询案例,通过大语言模型生成,保留了特定咨询师的语言风格与疗法技术,涵盖单轮与多轮对话。训练集约4760个对话,测试集约240个对话,总计超9万轮次,适合用于微调模型以模拟具有个性化咨询风格的心理健康助理。
Matrix 是面向大语言模型预训练的中英文大规模语料资源,包含多个来源和处理阶段,规模约为数万亿 token。
Egocentric-10K 是目前规模最大的以自我为中心视角的数据集,也是首个完全在真实工厂环境中采集的数据。它包含超过 10,000 小时、约 10.8 亿帧的视频素材,共 192,900 个视频片段,中位时长为 180 秒。视频采用 H.265 编码的 1080p 分辨率,帧率 30 fps,由单目头戴摄像机拍摄,视野为 128° 水平、67° 垂直。数据以 WebDataset 格式存储,每个 tar 包中视频与 JSON 元数据成对出现,并提供基于 OpenCV 鱼眼模型的相机内参。该数据集覆盖 85 个工厂中的多名工人,在手部可见性和主动操作密集度方面达到了当前最优水平。
这是一个中文多轮共情对话数据集,包含约25.8万条对话,共计151万轮交互。对话围绕心理支持、情感倾听与安慰等主题展开,采用多轮对话格式,每条数据包含用户和助手的多轮交流。该数据集旨在提升语言模型的共情、倾听与安慰能力,适用于情感对话相关的研究与训练。