数据集
2 个数据集
热门分类:
Bill13579/beltout
已完整同步
BeltOut 是一个基于 ChatterboxVC 的零样本语音到语音音色迁移模型,能够在不改变原始表演细节(如语调、情感)的前提下,仅替换音色(timbre)。它通过 192 维的 x-vector 表示任意音色,可应用于任意输入语音,实现精准的音色转换。该模型旨在学习音色对表演传递的通用影响,从而生成与目标音色一致的完整语音输出。
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。