数据集

1 个数据集
已选筛选: 文本转语音 GITATTRIBUTES mit 清除所有筛选
microsoft/VibeVoice-1.5B 已完整同步
VibeVoice是一款面向多说话人、长篇幅对话音频生成的开源文本转语音模型,支持英文和中文。它采用创新的连续语音分词器(声学和语义),以超低帧率(7.5Hz)高效保留音频质量,并结合大语言模型与扩散解码器,能够从文本直接合成最长90分钟、包含最多4个不同说话人的自然对话音频(如播客)。该模型基于Qwen2.5-1.5B架构,通过课程学习策略逐步扩展上下文长度至65,536个token,在保持说话人一致性和流畅对话轮换方面表现出色。
GITATTRIBUTESJSONMDPNGSAFETENSORS MIT License 5.0 GiB 9 个文件 WeHub 同步于 2026-08-27 15:14:20 +00:00