数据集

5 个数据集
已选筛选: MODEL MIT 清除所有筛选
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
GITATTRIBUTESGITIGNOREJSONMDMODELPTPYSAFETENSORSTXTYAML MIT License 40 GiB 64 个文件 WeHub 同步于 2026-08-28 10:58:25 +00:00
zai-org/GLM-TTS 已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
CKPTGITATTRIBUTESJSONMDMODELPTPYSAFETENSORSYAML MIT License 8.3 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Skywork/Matrix-Game-2.0 已完整同步
Matrix-Game-2.0 是一个开源的实时交互式世界模型,基于扩散架构实现高效的流式视频生成。它能够以 25 FPS 的速度实时合成分钟级的高保真视频,并支持通过鼠标和键盘精确控制画面内容,实现帧级别的动态响应。该模型从视觉内容和用户动作直接预测后续帧,无需文本输入,在多种复杂场景下均表现出色。
GITATTRIBUTESJSONMDMODELPNGPTHSAFETENSORS MIT License 26 GiB 18 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/BGE-VL-v1.5-zs 已完整同步
BGE-VL是一系列面向通用多模态检索的嵌入模型,包括基于CLIP的base和large版本,以及融合多模态大语言模型的MLLM版本。这些模型借助MegaPairs数据集进行训练——该数据集通过创新的合成方法,利用开放域图像生成了超过2600万条异构KNN三元组,显著提升了多模态检索的性能。在组合图像检索等任务中,BGE-VL-MLLM模型相比此前最优方法取得了8.1%的改进。
GITATTRIBUTESJINJAJSONMDMODELPNGPYSAFETENSORS MIT License 9.5 GiB 29 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
HiDream-ai/HiDream-E1-Full 已完整同步
HiDream-E1 是一个基于指令驱动的图像编辑模型,能够根据用户提供的自然语言描述对输入图像进行编辑。它支持灵活的编辑指令格式,例如“将图片转换为吉卜力风格”,并配合目标图像描述来精确控制输出效果。该模型结合了 Llama 3.1 文本编码器与扩散 Transformer 架构,可在保持图像整体结构的同时实现多样化的风格转换和内容修改。
GITATTRIBUTESJPGJSONMDMODELSAFETENSORSTXT MIT License 44 GiB 37 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00