数据集

3 个数据集
已选筛选: YAML MIT 模型 清除所有筛选
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
GITATTRIBUTESGITIGNOREJSONMDMODELPTPYSAFETENSORSTXTYAML MIT License 40 GiB 64 个文件 WeHub 同步于 2026-08-28 10:58:25 +00:00
zai-org/GLM-4.7 已完整同步
GLM-4.7是一个专注于编码和复杂推理的语言模型,支持英文和中文。相比前代,它在多语言代理编码、终端任务、工具使用和复杂推理方面均有显著提升,同时优化了UI生成质量,能够生成更精美、布局更准确的网页和幻灯片。
GITATTRIBUTESJINJAJSONMDSAFETENSORSYAML MIT License 668 GiB 104 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
zai-org/GLM-TTS 已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
CKPTGITATTRIBUTESJSONMDMODELPTPYSAFETENSORSYAML MIT License 8.3 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00