数据集

1 个数据集
已选筛选: SVG MIT 清除所有筛选
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
BINGITATTRIBUTESJSONMDONNXPNGPTSAFETENSORSSVG MIT License 99 GiB 34 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00