数据集
45 个数据集
热门分类:
Wan-AI/Wan2.2-S2V-14B
已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
RYS-Qwen3.5-27B-FP8-S 是一个基于 Qwen3.5 的 27B 参数因果语言模型,采用 FP8 量化(块大小 128)以降低存储和推理开销,同时保持与原始模型几乎一致的性能。该模型集成了视觉编码器,支持图像到文本的多模态任务,原生上下文长度达 262,144 token,并可扩展至 1,010,000 token。架构上融合了 Gated Delta Networks 与稀疏混合专家(MoE),在高效推理的同时兼顾多模态理解、推理、代码生成和智能体能力。它经过大规模强化学习训练,并支持 201 种语言,适用于全球部署场景。
RYS-Qwen3.5-27B-FP8-M 是一个基于 Qwen3.5-27B 的 FP8 量化版本,拥有 27B 参数,采用细粒度 128 块大小的 FP8 量化,性能与原始模型几乎一致。它属于因果语言模型,并集成了视觉编码器,支持图像到文本的多模态任务。模型采用高效的 Gated Delta 网络与稀疏 MoE 混合架构,原生支持 262,144 令牌的上下文长度,并可扩展至约 100 万令牌。在训练中引入了可扩展的强化学习,覆盖 201 种语言,在推理、编码、智能体及视觉理解等方面表现出色。
RYS-Qwen3.5-27B-FP8-L 是基于 Qwen3.5-27B 的 FP8 量化版本,采用块大小为 128 的细粒度量化方法,性能与原始模型几乎一致。该模型融合了多模态学习与高效的混合架构,支持文本和图像输入,原生上下文长度可达 262,144 个token,并可通过扩展支持至超过 100 万 token。它在大规模强化学习训练中表现出色,覆盖 201 种语言,适用于多种复杂场景。
MYZY-AI/Muyan-TTS
已完整同步
Muyan-TTS是一个面向播客应用的可训练文本转语音模型。它在超过10万小时的播客音频数据上进行了预训练,支持零样本高质量语音合成,并能通过短短几分钟的目标语音实现说话人自适应,从而灵活地定制个性化声音。
ByteDance/Q-Insight
已完整同步
Q-Insight 是一个专注于图像质量理解的视觉语言模型,通过视觉强化学习进行训练。它基于 Qwen2.5-VL-7B-Instruct 进行微调,采用 Apache-2.0 开源协议。该模型主要面向图像质量评估(IQA)、视频质量评估(VQA)以及 AIGC 内容的理解任务。
BAAI/Video-XL-2
已完整同步
Video-XL-2 是一个支持视频与文本交互的多模态模型,能够根据视频内容回答用户的问题。它针对长视频场景提供了两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层 KV 缓存解码(bi-level kvs decoding),可以有效降低显存占用和响应延迟,适合处理较长视频的推理任务。
这是一个基于 Qwen3-VL-8B-Thinking 的 8 位量化模型,支持图像到文本的生成任务,例如描述图片内容。模型采用 MLX 格式,方便在 Apple 设备上高效运行。
LLaDA2.0-flash-preview 是一个基于扩散技术的语言模型,采用混合专家(MoE)架构,总参数量达1000亿,但推理时仅激活约61亿参数,显著降低了计算成本。它在代码生成、复杂数学推理以及工具调用等任务上表现突出,并在多个基准测试中展现出与同类开源模型相比更优的性能。该模型支持指令微调,适用于实际应用场景,未来还将通过强化学习进一步提升推理能力。
M3-Agent-Control 是一个面向智能体控制任务的数据集,采用 Apache-2.0 许可证。数据集包含模型权重(以 safetensors 格式存储)、结构化文本、二进制数据及纯文本等多种内容类型,适用于相关领域的模型训练与评估。
TimesFM 是一个预训练的时间序列基础模型,专为时间序列预测任务设计。它采用仅解码器架构,在多种数据上进行了预训练,包括合成和增强数据。该模型支持 PyTorch 框架,能够处理最大上下文长度为1024、最大预测步长为256的时间序列,并提供输入归一化、连续分位数预测、翻转不变性等功能,适用于多种预测场景。
Qwen/Qwen3.5-397B-A17B
已完整同步
Qwen3.5-397B-A17B是一个大规模多模态语言模型,总参数量达3970亿,每个token仅激活约170亿参数。它采用高效的混合架构,融合Gated Delta Networks与稀疏混合专家(MoE),在视觉理解、推理、编码和智能体等任务上表现优异。该模型原生支持26万tokens上下文长度,并可扩展至百万级,同时覆盖201种语言,具备强大的多语言能力。通过扩展规模的强化学习训练和接近100%的多模态训练效率,它在保持高性能的同时实现了较低的推理成本。
BAAI/bge-code-v1
已完整同步
BAAI/bge-code-v1 是一个基于大语言模型的代码嵌入模型,专注于代码检索、文本检索和多语言检索。它能够用中英文自然语言查询以及 20 种编程语言进行高效代码检索,同时保持与同等规模文本嵌入模型相当的文本检索能力,并支持英语、中文、日语、法语等多种语言。该模型基于 sentence-transformers 框架,采用 Apache-2.0 许可证。
Kwai-Keye/Keye-VL-1_5-8B
已完整同步
Kwai Keye-VL-1.5 是一款前沿的多模态大语言模型,专注于视频理解与推理。它采用了创新的“慢-快”视频编码策略,通过渐进式四阶段预训练方法将上下文长度扩展至128K tokens,并设计了全面的后训练流程,以增强推理能力和对齐人类偏好。该模型在视频理解任务上表现出显著提升,同时在其他多模态基准测试中保持竞争力。
Fun-CosyVoice 3.0 是一个基于大语言模型的先进文本转语音(TTS)系统,在内容一致性、说话人相似度和韵律自然度上均超越前代。它支持9种常见语言(中、英、日、韩、德、西、法、意、俄)以及18种以上中文方言/口音,同时具备跨语言零样本语音克隆能力。系统还提供发音修复、文本标准化、低延迟流式输出和指令控制(如语言、情感、语速、音量)等实用功能,适合生产环境使用。
GLM-4.7-185B-W4A16 是一个经过 4 比特权重量化(W4A16)的混合专家(MoE)模型,基于 GLM-4.7-185B 压缩而来。模型总参数量为 1850 亿,采用 INT4 权重与 FP16 激活的格式,磁盘占用约 99 GB,适用于文本生成任务。该量化版本在保持模型能力的同时显著降低了存储和推理时的显存需求。
LongCat-Image 是一个开源的、中英双语的图像生成基础模型,拥有60亿参数。它在保持高效性能的同时,在多个基准测试中超越了数倍于自身规模的模型,尤其擅长中文文字渲染,能准确稳定地生成常见汉字,并覆盖了广泛的汉字字典。此外,该模型通过创新的数据策略和训练框架,能够生成具有出色照片级真实感的图像。
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
Nanbeige/Nanbeige4.1-3B
已完整同步
Nanbeige4.1-3B 是基于 Nanbeige4-3B-Base 构建的轻量级推理模型,通过监督微调与强化学习进一步优化,在保持小参数规模的同时展现出强大的推理能力、偏好对齐效果和智能体行为。它能够通过单次前向传播完成复杂多步推理,并在代码、数学、科学等多项基准测试中超越同规模及部分更大模型。此外,Nanbeige4.1-3B 原生支持深度搜索任务,可稳定执行超过 500 轮工具调用,填补了小型模型在通用推理与智能体场景中兼顾不足的空白。