数据集
30 个数据集
热门分类:
Kimi-Audio-7B-Instruct 是一个开源音频基础模型,统一处理音频理解、生成与对话任务。支持语音识别、音频问答、描述、情感识别、事件分类及端到端语音对话,基于大规模多模态预训练与混合音频输入架构,实现高效推理与流式音频生成。适用于语音交互、音频内容分析等场景。
microsoft/VibeVoice-1.5B
已完整同步
VibeVoice是一款面向多说话人、长篇幅对话音频生成的开源文本转语音模型,支持英文和中文。它采用创新的连续语音分词器(声学和语义),以超低帧率(7.5Hz)高效保留音频质量,并结合大语言模型与扩散解码器,能够从文本直接合成最长90分钟、包含最多4个不同说话人的自然对话音频(如播客)。该模型基于Qwen2.5-1.5B架构,通过课程学习策略逐步扩展上下文长度至65,536个token,在保持说话人一致性和流畅对话轮换方面表现出色。
BAAI/bge-small-en-v1.5
已完整同步
这是一个轻量级的英文句子嵌入模型,属于bge系列,能够将文本转换为向量表示,适用于特征提取、句子相似度计算和语义搜索等任务。它在多个自然语言处理基准测试中表现出色,涵盖分类、检索、聚类、重排序和语义文本相似度等场景,兼顾了效率与性能。
zai-org/GLM-4.7
已完整同步
GLM-4.7是一个专注于编码和复杂推理的语言模型,支持英文和中文。相比前代,它在多语言代理编码、终端任务、工具使用和复杂推理方面均有显著提升,同时优化了UI生成质量,能够生成更精美、布局更准确的网页和幻灯片。
GLM-4.1V-9B-Thinking 是一个面向推理增强的开源视觉语言模型,基于 GLM-4-9B-0414 构建,通过引入“思考范式”与强化学习显著提升了复杂任务的准确性与完整性。该模型在 10B 参数级别的视觉语言模型中达到领先水平,在 18 项基准测试上甚至超越 72B 参数的 Qwen-2.5-VL-72B。它支持长达 64k 的上下文、任意宽高比及最高 4K 图像分辨率,并具备中英双语能力,适用于数学推理、长上下文理解及多模态智能体等应用场景。
MMLU 是英文多任务语言理解评测集,覆盖抽象代数、法律、医学、计算机科学等多个学科,以多项选择题评估模型的知识与推理能力。
zai-org/GLM-TTS
已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
该数据集包含用于文本分类的评分标准(rubrics),覆盖健康、通用和金融三个领域。其中健康与通用领域各有5000条训练提示及对应评分标准,并额外提供1000条提示用于端到端胜率对比;金融领域提供1145条训练提示及评分标准。数据以JSONL格式存储,可用于基于评分标准的强化学习奖励建模。
ToxiMol 是一个专门用于分子毒性修复的基准数据集,包含 660 个具有代表性的有毒分子,覆盖多种毒性机制和不同粒度。它提供了 11 项主要的毒性修复任务,每个任务对应一个特定的毒性终点(如致突变性、致癌性、心脏毒性等)。数据集采用多模态输入,包括 SMILES 字符串和通过 RDKit 渲染的二维分子结构图像,旨在评估多模态大语言模型在结构层面进行分子去毒化时的能力。该基准适用于分类与回归任务,是药物发现和分子设计领域的重要资源。
deepseek-ai/Janus-Pro-7B
已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
Skywork/Matrix-Game
已完整同步
Matrix-Game是一个大规模Minecraft数据集,包含细粒度的键盘和鼠标动作标注,专为训练交互式、物理基础的世界模型而设计。该数据集可配合17B参数的扩散模型,用于生成高质量、可控的游戏世界视频,并支持对场景演化进行精细控制。
inclusionAI/Ring-1T
已完整同步
Ring-1T 是一个万亿参数级别的开源思考模型,采用 Ling 2.0 架构,总参数量达 1 万亿,激活参数为 500 亿,支持最长 128K 的上下文窗口。该模型通过大规模可验证奖励强化学习(RLVR)训练,显著提升了自然语言推理能力,并经过 RLHF 优化使通用能力更加均衡,在数学竞赛、代码生成和逻辑推理等挑战性基准上表现领先。
Ling-flash-2.0 是一款基于 MoE 架构的开源语言模型,总参数量达 100B,但每次推理仅激活约 6.1B 参数(非嵌入部分 4.8B),实现了高效计算与卓越性能的平衡。该模型在 20T+ tokens 的高质量数据上训练,并经过监督微调与多阶段强化学习优化,在复杂推理、数学、代码生成和前端开发等任务中表现出色,尤其以极小的激活参数达到了与 40B 稠密模型相当的水平。推理速度上,在 H20 硬件上可达 200+ tokens/s,并支持 128K 上下文长度,兼具高吞吐与长序列处理能力。
DeepSeek-V3.2-REAP-345B-A37B 是一个基于 DeepSeek-V3.2 高效压缩而来的稀疏混合专家(SMoE)语言模型。通过名为 REAP 的专家剪枝方法,模型在保留路由器对剩余专家独立控制的前提下,均匀剪除了 50% 的专家,参数量从 671B 压缩至 345B,每 token 仅激活 37B 参数。该模型在代码生成、数学推理、工具调用等任务上保持了近乎无损的性能,同时显著降低了内存占用和部署成本。它可直接兼容标准 vLLM 推理框架,无需额外修改,特别适合资源受限环境、本地部署及学术研究场景。
DeepSeek-V3.2-REAP-508B-A37B 是一个基于 DeepSeek-V3.2 压缩得到的稀疏混合专家语言模型。它通过 REAP(路由器加权专家激活剪枝)方法,均匀地剪除了 25% 的专家,将总参数量从 671B 压缩至 508B,而每次推理仅激活 37B 参数。该模型在代码生成、数学推理、函数调用等任务上几乎保持了与原版相同的性能,同时显著降低了内存占用和部署成本。它兼容 vLLM 等主流推理框架,无需额外修改即可直接使用,特别适合资源受限的环境和本地部署。
XiaomiMiMo/MiMo-V2-Flash
已完整同步
MiMo-V2-Flash 是面向文本生成与推理的大语言模型资源,镜像包含模型权重、配置和推理代码等文件,不属于可按行读取的传统数据集。
LongCat-Video-Avatar 是一个统一的模型,能够根据音频驱动生成富有表现力和高度动态的角色动画。它支持多种生成模式,包括音频-文本生成视频、音频-文本-图像生成视频,以及视频延续,并且兼容单流和多流音频输入。该模型通过解耦无条件引导实现自然的人体动态,采用参考跳跃注意力避免内容重复,并利用跨块潜在拼接减少长序列中的像素退化。
microsoft/TRELLIS.2-4B
已完整同步
TRELLIS.2-4B 是一个面向图像到 3D 生成的大规模模型,拥有 40 亿参数。它基于一种名为 O-Voxel 的新型稀疏体素结构,能够直接从单张图像重建或生成任意拓扑的 3D 资产,并带有完整的物理渲染(PBR)材质,包括透明与半透明效果。该模型支持最高 1536³ 分辨率的高质量输出,并采用流匹配变换器架构,生成速度快、潜空间紧凑。
Skywork/Matrix-Game-2.0
已完整同步
Matrix-Game-2.0 是一个开源的实时交互式世界模型,基于扩散架构实现高效的流式视频生成。它能够以 25 FPS 的速度实时合成分钟级的高保真视频,并支持通过鼠标和键盘精确控制画面内容,实现帧级别的动态响应。该模型从视觉内容和用户动作直接预测后续帧,无需文本输入,在多种复杂场景下均表现出色。