数据集
7 个数据集
热门分类:
Tongyi-MAI/Z-Image-Turbo
已完整同步
Z-Image-Turbo 是一个高效的图像生成模型,基于单流扩散 Transformer 架构,拥有 6B 参数。它通过蒸馏技术实现了仅需 8 步评估即可生成高质量图像,推理延迟可低至亚秒级,并能在 16G 显存的消费级设备上运行。该模型擅长生成逼真的图像,支持中英文双语文本渲染,且具备良好的指令跟随能力。此外,该系列还包括 Z-Image 基础模型、支持生成与编辑的 Z-Image-Omni-Base 以及专注于图像编辑的 Z-Image-Edit 等变体,覆盖了从高质量生成到精细编辑的多种场景。
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
HiDream-E1 是一个基于指令驱动的图像编辑模型,能够根据用户提供的自然语言描述对输入图像进行编辑。它支持灵活的编辑指令格式,例如“将图片转换为吉卜力风格”,并配合目标图像描述来精确控制输出效果。该模型结合了 Llama 3.1 文本编码器与扩散 Transformer 架构,可在保持图像整体结构的同时实现多样化的风格转换和内容修改。
LongCat-Image 是一个开源的、中英双语的图像生成基础模型,拥有60亿参数。它在保持高效性能的同时,在多个基准测试中超越了数倍于自身规模的模型,尤其擅长中文文字渲染,能准确稳定地生成常见汉字,并覆盖了广泛的汉字字典。此外,该模型通过创新的数据策略和训练框架,能够生成具有出色照片级真实感的图像。
Qwen/QwQ-32B
已完整同步
QwQ-32B是Qwen系列中的推理模型,拥有32.5B参数,基于Transformer架构,支持最长131,072 tokens的上下文。它经过预训练、监督微调与强化学习,具备深度思考与推理能力,在复杂任务上表现优异,可对标业界领先的推理模型。
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。
DeepAnalyze-8B 是一个面向自主数据科学领域的智能体大语言模型,能够无需人工干预自动完成数据准备、分析、建模、可视化和报告生成等一系列数据科学任务。它支持结构化数据(如数据库、CSV、Excel)、半结构化数据(如 JSON、XML、YAML)和非结构化数据(如 TXT、Markdown),并可生成分析师级的研究报告。该模型已完全开源,方便用户部署或扩展自己的数据分析助手。