数据集

1 个数据集
已选筛选: 文本转语音 JPG 模型 清除所有筛选
SparkAudio/Spark-TTS-0.5B 已完整同步
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。
BINGITATTRIBUTESJPGJSONMDPNGSAFETENSORSTXTYAML Apache License 2.0 3.7 GiB 31 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00