数据集
4 个数据集
热门分类:
openbmb/VoxCPM1.5
已完整同步
VoxCPM1.5 是一个无需分词器的文本转语音(TTS)系统,能够生成上下文感知、富有表现力的语音,并实现逼真的零样本声音克隆。该模型基于 MiniCPM4-0.5B,采用扩散自回归架构直接生成连续语音表示,在 180 万小时双语语料上训练。相比前代版本,它支持 44.1kHz 高采样率输出,提高了音质,同时将 token 率降至 6.25Hz,提升效率。支持流式合成,实时因子低至 0.17,并可通过 SFT 或 LoRA 进行微调,适配个性化语音模型。
Wan-AI/Wan2.2-S2V-14B
已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
MYZY-AI/Muyan-TTS
已完整同步
Muyan-TTS是一个面向播客应用的可训练文本转语音模型。它在超过10万小时的播客音频数据上进行了预训练,支持零样本高质量语音合成,并能通过短短几分钟的目标语音实现说话人自适应,从而灵活地定制个性化声音。
nari-labs/Dia-1.6B
已完整同步
Dia是一个拥有1.6B参数的文本到语音模型,能够直接从脚本生成高度逼真的对话。它支持通过音频条件控制情感和语调,还能输出笑声、咳嗽等非语言声音。目前仅支持英文生成。