数据集
206 个数据集
热门分类:
OmniThoughtV 是一个大规模多模态长链推理数据集,包含约 180 万条样本。数据集通过蒸馏技术构建,将图像与思维链推理过程相结合,样本格式包含系统提示、用户问题以及助手的逐步推理和最终答案,图像以 base64 编码字符串存储。使用该数据集微调模型,能够有效提升模型在视觉理解和推理任务上的表现,尤其在推理密集型基准上效果显著。
这是一个由社区贡献的AI提示词(prompts)数据集,包含大量用户分享的各类对话提示,适用于ChatGPT、Claude、Gemini、Llama、Mistral等主流AI聊天模型。数据覆盖问答和文本生成任务,规模在10万到100万条之间,提供CSV等格式,方便直接使用和分析。
该数据集聚焦于机器人操作任务,包含在家庭场景中使用机械臂拾取纸板箱并放入纸箱的完整过程。数据涵盖402个操作片段、约18.8万帧,提供8个相机视角的视频及状态、动作数据。附有精细的子任务分割、场景描述、末端执行器方向和速度等注释,支持机器人学习与操作技能研究。
SenseVoice多语言语音理解模型Small
已完整同步
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
CAM++ 说话人确认模型基于密集连接时延神经网络,专为中文通用场景设计,在约 200k 说话人的大规模数据集上训练而成。该模型在说话人识别任务中兼顾高性能与高效率,相比主流模型(如 ResNet34、ECAPA-TDNN)在准确率与推理速度上均有优势,可广泛用于说话人确认、说话人日志、语音合成及说话人风格转换等场景。
FSMN语音端点检测-中文-通用-16k
已完整同步
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
emotion2vec_plus_large 是一个通用语音情感识别基座模型,专注于从语音中识别出多种情感类别。它能够识别愤怒、厌恶、恐惧、开心、中性、其他、悲伤、惊讶和未知共9种情感状态,旨在通过大规模数据驱动的方式,提升跨语种和跨场景下的情感识别鲁棒性。该模型适用于需要从语音信号中提取情感信息的各类应用场景。
Bill13579/beltout
已完整同步
BeltOut 是一个基于 ChatterboxVC 的零样本语音到语音音色迁移模型,能够在不改变原始表演细节(如语调、情感)的前提下,仅替换音色(timbre)。它通过 192 维的 x-vector 表示任意音色,可应用于任意输入语音,实现精准的音色转换。该模型旨在学习音色对表演传递的通用影响,从而生成与目标音色一致的完整语音输出。
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
microsoft/VibeVoice-1.5B
已完整同步
VibeVoice是一款面向多说话人、长篇幅对话音频生成的开源文本转语音模型,支持英文和中文。它采用创新的连续语音分词器(声学和语义),以超低帧率(7.5Hz)高效保留音频质量,并结合大语言模型与扩散解码器,能够从文本直接合成最长90分钟、包含最多4个不同说话人的自然对话音频(如播客)。该模型基于Qwen2.5-1.5B架构,通过课程学习策略逐步扩展上下文长度至65,536个token,在保持说话人一致性和流畅对话轮换方面表现出色。
yiliu666/xiaoduan
已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
魔搭通用SFT数据集是MSAgent-Bench的一个子集,主要涵盖通用问答场景下的监督微调(SFT)数据。每条样本包含一个唯一标识符和对话内容,对话由system、user、assistant三种角色组成,system用于设定模型前置人设,user为用户的输入,assistant为模型的回复。该数据集适用于工具学习、API调用等任务场景,有助于提升模型在复杂交互中的表现。
这个数据集包含约11万条中文对话样本,每条数据由用户提问和模型回答组成,内容涵盖广泛的知识与推理场景。数据基于高性能大语言模型生成,旨在用于微调时作为通用数据集混合,帮助模型保持知识广度、避免遗忘。
基于FST的中文ITN
已完整同步
这是一个基于OpenFST构建的中文逆文本规范化(ITN)模型,支持自定义转换规则,能够将口语化表达(如“二点五平方电线”)转换为标准文本形式。模型通过Python接口调用,方便集成到各类文本处理流程中。
该数据集包含约14.5万条价值观比较样本,每条样本由问题(prompt)、正例回复和负例回复组成,并标注了回复的类型(如“拒绝为主”或“风险回复”)。数据集可用于大模型安全与价值观对齐的相关研究,例如通过正例增强模型安全性、利用正反例训练奖励模型,或构造多项选择题来评估模型表现。数据采用JSONL格式,分为训练和测试两部分。
这个数据集是经过去重处理的大规模文本语料库,涵盖多种内容类型,包括结构化文本、纯文本、列式数据及二进制文件。数据以 Parquet、JSON 和 Markdown 等格式提供,适用于训练语言模型等自然语言处理任务。该数据集采用 Apache 2.0 许可证。
Chinese-medical-dialogue 是中文医疗对话资源,包含医疗领域问答或对话文本,适合用于医疗对话理解、检索和文本分类研究。
hy_mm_data_v0901 是一个大规模多格式资源包,当前镜像包含约 1,631 个文件、约 1.22 TB 数据,主要为 ZIP 压缩包及说明/元数据文件;使用前应按目录和压缩包检查具体内容与字段。
这个数据集专为 LaTeX 光学字符识别(OCR)任务设计,包含图像到文本的配对样本。它提供了多种子集:一个约 100K 样本的印刷体完整数据集,一个同样规模的手写体合成数据集,以及一个较小但更贴近真实手写场景的数据集。此外,还有一个小规模测试集(110 条)和基于真实手写公式渲染的印刷体版本。每个子集都划分为训练、验证和测试三部分,方便模型训练与评估。
该数据集包含2019年至2021年期间部分上市公司的年报,共11588个PDF文件,总大小约69GB。内容涵盖公司组织架构、员工结构、业务进展、财务数据、战略规划等丰富信息,可用于训练AI模型解读年报、进行深度金融分析。数据集旨在提升大模型在金融场景中的交互能力,适用于构建金融知识问答库、向量库等应用。