数据集
168 个数据集
热门分类:
这是一个基于 MiniLM-L6 架构的 Cross-Encoder 模型,专门针对 MS Marco 段落排序任务训练而成。它主要用于信息检索中的重排序阶段:给定一个查询,先通过检索工具(如 ElasticSearch)召回一批候选段落,再用该模型对每个查询‑段落对进行相关性打分,最后按分数降序排列,以提升排序质量。模型可通过 SentenceTransformers 或 Transformers 库直接调用,输入查询和段落文本,即可输出相关性分数。在 TREC Deep Learning 2019 和 MS Marco 开发集上,它均取得了较好的排序效果,兼顾了速度与准确度。
zai-org/CogVideoX-2b
已完整同步
CogVideoX-2B 是一个文本到视频的生成模型,能够根据英文描述生成连贯的视频内容。该模型采用 Apache-2.0 开源许可证,适用于视频生成相关的研究和应用。
Ming-UniAudio 是一个统一的语音理解、生成与编辑框架,其核心创新在于提出了一种基于 VAE 架构的连续语音分词器,首次将语义与声学特征有效融合,使同一个语言模型既能理解语音也能生成语音。在此基础上,该模型通过扩散头增强生成保真度,并进一步训练出首个仅凭自然语言指令即可完成自由形式语音编辑的模型,无需人工指定待编辑区域,支持复杂的语义和声学修改。
ASLP-lab/DiffRhythm2
已完整同步
DiffRhythm 2 是新一代开源音乐生成框架,基于半自回归扩散架构,能够生成完整歌曲,并实现精确的歌词对齐与连贯的音乐结构。其名称中的“Diff”代表扩散生成主干,“Rhythm”强调对音乐性与时间流动的专注,中文名“谛韵”则融合了“谛”(专注聆听)与“韵”(旋律魅力)的双重寓意。
openbmb/VoxCPM1.5
已完整同步
VoxCPM1.5 是一个无需分词器的文本转语音(TTS)系统,能够生成上下文感知、富有表现力的语音,并实现逼真的零样本声音克隆。该模型基于 MiniCPM4-0.5B,采用扩散自回归架构直接生成连续语音表示,在 180 万小时双语语料上训练。相比前代版本,它支持 44.1kHz 高采样率输出,提高了音质,同时将 token 率降至 6.25Hz,提升效率。支持流式合成,实时因子低至 0.17,并可通过 SFT 或 LoRA 进行微调,适配个性化语音模型。
zai-org/GLM-TTS
已完整同步
GLM-TTS 是一个基于大语言模型的高质量文本转语音合成系统,支持零样本语音克隆与流式推理。它采用两阶段架构:先由 LLM 将输入文本转换为语音 token 序列,再通过 Flow Matching 模型生成高质量波形。系统引入了多奖励强化学习框架(GRPO),显著提升语音的表现力,实现更自然的情绪控制。关键特性包括仅需 3-10 秒音频即可克隆任意说话人声音、RL 增强的情感表达、音素级精确发音控制、支持中英双语混合文本,以及实时流式生成。
ZhejiangLab/Gengram
已完整同步
Gengram-10B 是一个为基因组基础模型设计的条件记忆模块,通过显式基序记忆检索增强基于 Transformer 的 DNA 序列建模。它采用哈希查找表存储和检索 k-mer(k=1-6),并引入 21 碱基对窗口机制以对齐 DNA 螺旋结构,在保持线性时间复杂度的同时提升计算效率。该模块兼容多种注意力机制(如 MHA、GQA、MLA),支持混合专家模型中的负载均衡,并具备生物可解释性:记忆嵌入呈现反向互补对称性,门控机制随功能区域变化,从浅层到深层形成层次化表示。
sarosavo/Master-RM
已完整同步
这是一个用于训练鲁棒生成式奖励模型(Master-RM)的合成数据集,包含约18万条训练样本。每条样本由问题、回答和二元偏好标签组成,适用于监督微调、偏好优化等任务。数据集特别针对生成式奖励模型容易被表面操作(如无意义符号或推理开头)欺骗的漏洞进行了增强,通过额外添加2万个负例样本,帮助模型提升抵抗这类攻击的鲁棒性。
该数据集包含用于文本分类的评分标准(rubrics),覆盖健康、通用和金融三个领域。其中健康与通用领域各有5000条训练提示及对应评分标准,并额外提供1000条提示用于端到端胜率对比;金融领域提供1145条训练提示及评分标准。数据以JSONL格式存储,可用于基于评分标准的强化学习奖励建模。
openbmb/MiniCPM-SALA
已完整同步
MiniCPM-SALA是一种创新的大规模混合注意力模型,首次将稀疏注意力与线性注意力高效融合,专为百万级令牌的上下文建模设计。它采用25%的稀疏注意力层(基于InfLLM-v2)和75%的线性注意力层(Lightning Attention),在保持高保真长上下文建模能力的同时,突破了计算和内存瓶颈,实现了3.5倍的推理加速,并显著降低KV缓存开销。通过混合位置编码(HyPE)和基于蒸馏的HALO训练策略,该模型能够扩展到百万令牌以上的上下文长度,同时在通用知识、数学和代码等任务上保持与全注意力模型相当的性能。
PKU-DS-LAB/FairyR1-32B
已完整同步
FairyR1-32B 是一个高效的大语言模型,由北京大学 DS-LAB 团队开发。它基于 DeepSeek‑R1‑Distill‑Qwen‑32B 构建,采用创新的“蒸馏-融合”流程,仅用约 5% 的参数规模,便在数学竞赛(如 AIME 2024/2025)和代码生成(如 LiveCodeBench)等任务上取得了与 DeepSeek‑R1‑671B 相当甚至更优的成绩。该模型通过优化数据蒸馏管道和多专家模型融合,在显著降低推理成本的同时,保持了出色的任务性能。
ToxiMol 是一个专门用于分子毒性修复的基准数据集,包含 660 个具有代表性的有毒分子,覆盖多种毒性机制和不同粒度。它提供了 11 项主要的毒性修复任务,每个任务对应一个特定的毒性终点(如致突变性、致癌性、心脏毒性等)。数据集采用多模态输入,包括 SMILES 字符串和通过 RDKit 渲染的二维分子结构图像,旨在评估多模态大语言模型在结构层面进行分子去毒化时的能力。该基准适用于分类与回归任务,是药物发现和分子设计领域的重要资源。
deepseek-ai/Janus-Pro-7B
已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
openbmb/MiniCPM-V-4_5
已完整同步
MiniCPM-V 4.5 是一款基于 Qwen3-8B 和 SigLIP2-400M 构建的多模态大语言模型,总参数量为 8B。它在视觉语言能力上表现出色,在多项基准测试中平均得分超过 GPT-4o-latest 等主流模型,并支持高效的高帧率视频理解,通过 3D 重采样器实现 96 倍视频 token 压缩。该模型具备可控的快速与深度思考模式切换,以及强大的 OCR、文档解析和多语言处理能力,支持最高 1.8 百万像素的高分辨率图像输入,并提供了多种量化与推理方式以适配不同使用场景。
Wan-AI/Wan2.2-S2V-14B
已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
RYS-Qwen3.5-27B-FP8-S 是一个基于 Qwen3.5 的 27B 参数因果语言模型,采用 FP8 量化(块大小 128)以降低存储和推理开销,同时保持与原始模型几乎一致的性能。该模型集成了视觉编码器,支持图像到文本的多模态任务,原生上下文长度达 262,144 token,并可扩展至 1,010,000 token。架构上融合了 Gated Delta Networks 与稀疏混合专家(MoE),在高效推理的同时兼顾多模态理解、推理、代码生成和智能体能力。它经过大规模强化学习训练,并支持 201 种语言,适用于全球部署场景。
RYS-Qwen3.5-27B-FP8-M 是一个基于 Qwen3.5-27B 的 FP8 量化版本,拥有 27B 参数,采用细粒度 128 块大小的 FP8 量化,性能与原始模型几乎一致。它属于因果语言模型,并集成了视觉编码器,支持图像到文本的多模态任务。模型采用高效的 Gated Delta 网络与稀疏 MoE 混合架构,原生支持 262,144 令牌的上下文长度,并可扩展至约 100 万令牌。在训练中引入了可扩展的强化学习,覆盖 201 种语言,在推理、编码、智能体及视觉理解等方面表现出色。
RYS-Qwen3.5-27B-FP8-L 是基于 Qwen3.5-27B 的 FP8 量化版本,采用块大小为 128 的细粒度量化方法,性能与原始模型几乎一致。该模型融合了多模态学习与高效的混合架构,支持文本和图像输入,原生上下文长度可达 262,144 个token,并可通过扩展支持至超过 100 万 token。它在大规模强化学习训练中表现出色,覆盖 201 种语言,适用于多种复杂场景。
Skywork/Matrix-Game
已完整同步
Matrix-Game是一个大规模Minecraft数据集,包含细粒度的键盘和鼠标动作标注,专为训练交互式、物理基础的世界模型而设计。该数据集可配合17B参数的扩散模型,用于生成高质量、可控的游戏世界视频,并支持对场景演化进行精细控制。