数据集
25 个数据集
热门分类:
SenseVoice多语言语音理解模型Small
已完整同步
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
emotion2vec_plus_large 是一个通用语音情感识别基座模型,专注于从语音中识别出多种情感类别。它能够识别愤怒、厌恶、恐惧、开心、中性、其他、悲伤、惊讶和未知共9种情感状态,旨在通过大规模数据驱动的方式,提升跨语种和跨场景下的情感识别鲁棒性。该模型适用于需要从语音信号中提取情感信息的各类应用场景。
Robin021/DISC-Law-SFT
已完整同步
这是一个面向中文法律智能系统的高质量监督微调数据集,覆盖法律信息提取、判决预测、文档摘要和问答等任务。数据集包含两个子集:一个用于引入法律推理能力,另一个用于增强模型利用外部法律知识的能力。整体规模超过100万条,以中文问答和任务对话形式呈现,适合用于训练和评估法律领域的语言模型。
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
这个数据集专为 LaTeX 光学字符识别(OCR)任务设计,包含图像到文本的配对样本。它提供了多种子集:一个约 100K 样本的印刷体完整数据集,一个同样规模的手写体合成数据集,以及一个较小但更贴近真实手写场景的数据集。此外,还有一个小规模测试集(110 条)和基于真实手写公式渲染的印刷体版本。每个子集都划分为训练、验证和测试三部分,方便模型训练与评估。
modelscope/mmlu
已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
该数据集是一个用于图像描述(image captioning)任务的数据集,包含训练和验证两个子集。每条数据由图像、对应的描述文本以及图像ID组成,适合用于训练和评估图像描述模型。数据集规模在10k到1m之间,语言为英文。
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。
这是一个约 11 万条中文推理与指令样本的数据集,包含问题、推理过程和最终回答,面向大语言模型监督微调与中文推理能力训练。
这是一个涵盖美食、城市、企业家、汽车、明星八卦、生活常识、日常对话等丰富话题的中文对话数据集,包含约27万条精选对话。数据集特意加入了语义等价但表达形式多样的问答对,旨在帮助模型理解自然语言的多态性,提升泛化能力。适用于构建聊天机器人、学习seq2seq或Transformer模型等任务。
这个数据集包含了100种不同水果的图像,可用于图像分类任务的训练、验证和性能评估。数据集分为训练集和验证集,图片按类别存放在对应的文件夹中,格式为JPG。同时提供类名文件,方便标注对应关系。
funasr-demo
已完整同步
funasr-demo 是语音识别演示/测试资源,包含 WAV 音频、SCP/TXT/JSON 标注和说明文件,共 37 个文件、约 5.1 MB,适合 ASR 流程验证。
这是一个中文多轮共情对话数据集,包含约25.8万条对话,共计151万轮交互。对话围绕心理支持、情感倾听与安慰等主题展开,采用多轮对话格式,每条数据包含用户和助手的多轮交流。该数据集旨在提升语言模型的共情、倾听与安慰能力,适用于情感对话相关的研究与训练。
该数据集面向商品文案描述生成任务,属于data-to-text类型,可用于训练模型将商品卖点关键词转化为完整的文案描述。包含3848条测试样本,每条样本由输入的商品卖点词(text1)和输出的文案描述(text2)组成,适合用于生成式文本建模。
A1233213sswss/rvcmax
已完整同步
A1233213sswss/rvcmax 是 RVC 音色/语音模型资源包,按编号目录提供 WebP 预览图、Yuan 模型文件和 config.json,当前镜像约 1,389 个文件、25.7 GB。
这是一个包含训练图像的数据集,主要提供常见图片格式(如jpg、png、jpeg、webp)的文件,并附带一些元数据文件(如json、md),适用于图像处理或机器学习相关任务。
该数据集主要用于LaTeX OCR(光学字符识别)测试,包含图片(PNG格式)以及对应的标注文件(JSON、JSONL等),可用于训练或评估将LaTeX公式图像转换为可编辑文本的模型。
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
modelscope/gsm8k
已完整同步
GSM8K 是小学数学文字题与解答资源,当前镜像包含 JSON、脚本和说明文件,适合数学推理训练样例、模型评测和教育研究。