数据集
23 个数据集
热门分类:
SenseVoice多语言语音理解模型Small
已完整同步
SenseVoiceSmall 是一款高精度多语言语音识别模型,支持超过50种语言的语音识别,并具备情感辨识和音频事件检测能力。它采用非自回归端到端框架,推理速度极快,10秒音频仅需约70毫秒处理。模型不仅能识别语音内容,还能检测音乐、掌声、笑声等常见声学事件,并输出带有情感标签的富文本转写结果。此外,它还支持便捷的微调定制和完整的服务部署,适用于多种实际应用场景。
FSMN语音端点检测-中文-通用-16k
已完整同步
FSMN语音端点检测模型是一个中文通用的VAD模型,支持16kHz采样率。它能够准确检测长语音片段中有效语音的起止时间点,基于FSMN结构,在20,000小时工业级普通话数据上训练。该模型可与ASR模型组合使用,提升语音识别效率。
emotion2vec_plus_large 是一个通用语音情感识别基座模型,专注于从语音中识别出多种情感类别。它能够识别愤怒、厌恶、恐惧、开心、中性、其他、悲伤、惊讶和未知共9种情感状态,旨在通过大规模数据驱动的方式,提升跨语种和跨场景下的情感识别鲁棒性。该模型适用于需要从语音信号中提取情感信息的各类应用场景。
microsoft/VibeVoice-1.5B
已完整同步
VibeVoice是一款面向多说话人、长篇幅对话音频生成的开源文本转语音模型,支持英文和中文。它采用创新的连续语音分词器(声学和语义),以超低帧率(7.5Hz)高效保留音频质量,并结合大语言模型与扩散解码器,能够从文本直接合成最长90分钟、包含最多4个不同说话人的自然对话音频(如播客)。该模型基于Qwen2.5-1.5B架构,通过课程学习策略逐步扩展上下文长度至65,536个token,在保持说话人一致性和流畅对话轮换方面表现出色。
这是一个基于CT-Transformer架构的中文标点预测模型,适用于语音识别结果的后处理或纯文本输入的标点添加。它通过可控时延技术,在保持模型性能的同时有效降低了标点预测的延迟,能够在通用中文场景下输出具有可读性的文本。
该模型是一个面向中文普通话的离线语音识别模型,基于SeACoParaformer架构,支持热词定制功能,能够有效提升指定热词的识别准确率。模型采用非自回归解码方式,在16kHz采样率下运行,基于5万小时工业级中文任务数据训练,具有较好的泛化能力。在AISHELL-1-hotword测试集上,平均字错率(CER)为8.53%,每秒实时因子(RTF)为0.0251,兼顾了识别精度与推理速度。
这是一个中文通用语音识别模型,采用非自回归架构,支持对长达数小时的音频进行离线识别。模型集成了语音活动检测(VAD)、语音识别、标点恢复和时间戳输出功能,能够直接生成带标点的文字结果。在多个中文公开数据集上取得了领先的识别效果,可用于语音输入、会议纪要、语音导航等场景。
Tongyi-MAI/Z-Image-Turbo
已完整同步
Z-Image-Turbo 是一个高效的图像生成模型,基于单流扩散 Transformer 架构,拥有 6B 参数。它通过蒸馏技术实现了仅需 8 步评估即可生成高质量图像,推理延迟可低至亚秒级,并能在 16G 显存的消费级设备上运行。该模型擅长生成逼真的图像,支持中英文双语文本渲染,且具备良好的指令跟随能力。此外,该系列还包括 Z-Image 基础模型、支持生成与编辑的 Z-Image-Omni-Base 以及专注于图像编辑的 Z-Image-Edit 等变体,覆盖了从高质量生成到精细编辑的多种场景。
openbmb/VoxCPM1.5
已完整同步
VoxCPM1.5 是一个无需分词器的文本转语音(TTS)系统,能够生成上下文感知、富有表现力的语音,并实现逼真的零样本声音克隆。该模型基于 MiniCPM4-0.5B,采用扩散自回归架构直接生成连续语音表示,在 180 万小时双语语料上训练。相比前代版本,它支持 44.1kHz 高采样率输出,提高了音质,同时将 token 率降至 6.25Hz,提升效率。支持流式合成,实时因子低至 0.17,并可通过 SFT 或 LoRA 进行微调,适配个性化语音模型。
Wan-AI/Wan2.2-S2V-14B
已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
Skywork/Matrix-Game
已完整同步
Matrix-Game是一个大规模Minecraft数据集,包含细粒度的键盘和鼠标动作标注,专为训练交互式、物理基础的世界模型而设计。该数据集可配合17B参数的扩散模型,用于生成高质量、可控的游戏世界视频,并支持对场景演化进行精细控制。
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
Skywork/Matrix-Game-2.0
已完整同步
Matrix-Game-2.0 是一个开源的实时交互式世界模型,基于扩散架构实现高效的流式视频生成。它能够以 25 FPS 的速度实时合成分钟级的高保真视频,并支持通过鼠标和键盘精确控制画面内容,实现帧级别的动态响应。该模型从视觉内容和用户动作直接预测后续帧,无需文本输入,在多种复杂场景下均表现出色。
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
BAAI/BGE-VL-v1.5-zs
已完整同步
BGE-VL是一系列面向通用多模态检索的嵌入模型,包括基于CLIP的base和large版本,以及融合多模态大语言模型的MLLM版本。这些模型借助MegaPairs数据集进行训练——该数据集通过创新的合成方法,利用开放域图像生成了超过2600万条异构KNN三元组,显著提升了多模态检索的性能。在组合图像检索等任务中,BGE-VL-MLLM模型相比此前最优方法取得了8.1%的改进。
BAAI/BGE-VL-Screenshot
已完整同步
BAAI/BGE-VL-Screenshot 是一个面向视觉化信息检索(VisIR)的模型,能将文本、图像、表格、图表等多模态信息统一表示为截图形式,实现跨模态检索。它基于 Qwen2.5-VL-3B-Instruct 构建,采用 sentence-transformers 框架,支持中英文等多种语言,并配套了大规模截图数据集 VIRA 和综合评测基准 MVRB,旨在提升检索模型在处理多模态信息时的表现。
Kwai-Keye/Keye-VL-1_5-8B
已完整同步
Kwai Keye-VL-1.5 是一款前沿的多模态大语言模型,专注于视频理解与推理。它采用了创新的“慢-快”视频编码策略,通过渐进式四阶段预训练方法将上下文长度扩展至128K tokens,并设计了全面的后训练流程,以增强推理能力和对齐人类偏好。该模型在视频理解任务上表现出显著提升,同时在其他多模态基准测试中保持竞争力。
Fun-CosyVoice 3.0 是一个基于大语言模型的先进文本转语音(TTS)系统,在内容一致性、说话人相似度和韵律自然度上均超越前代。它支持9种常见语言(中、英、日、韩、德、西、法、意、俄)以及18种以上中文方言/口音,同时具备跨语言零样本语音克隆能力。系统还提供发音修复、文本标准化、低延迟流式输出和指令控制(如语言、情感、语速、音量)等实用功能,适合生产环境使用。
Nanbeige/Nanbeige4.1-3B
已完整同步
Nanbeige4.1-3B 是基于 Nanbeige4-3B-Base 构建的轻量级推理模型,通过监督微调与强化学习进一步优化,在保持小参数规模的同时展现出强大的推理能力、偏好对齐效果和智能体行为。它能够通过单次前向传播完成复杂多步推理,并在代码、数学、科学等多项基准测试中超越同规模及部分更大模型。此外,Nanbeige4.1-3B 原生支持深度搜索任务,可稳定执行超过 500 轮工具调用,填补了小型模型在通用推理与智能体场景中兼顾不足的空白。
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。