数据集
223 个数据集
热门分类:
该数据集是一个专门用于评估AI模型在临床场景中表现的医学数据集,聚焦于胸外科领域的非小细胞肺癌(NSCLC)分期与治疗规划。它包含92个精心设计的临床案例,覆盖术前评估、诊断流程、分期判断、治疗决策及风险分层等关键环节。数据集采用正负分相结合的多维度评分体系,从而对AI的临床决策能力进行量化评估。所有案例均经过多学科临床团队审核,确保专业性和准确性,可用于AI临床决策支持、医学教育及模型性能对比等场景。
ToxiMol 是一个专门用于分子毒性修复的基准数据集,包含 660 个具有代表性的有毒分子,覆盖多种毒性机制和不同粒度。它提供了 11 项主要的毒性修复任务,每个任务对应一个特定的毒性终点(如致突变性、致癌性、心脏毒性等)。数据集采用多模态输入,包括 SMILES 字符串和通过 RDKit 渲染的二维分子结构图像,旨在评估多模态大语言模型在结构层面进行分子去毒化时的能力。该基准适用于分类与回归任务,是药物发现和分子设计领域的重要资源。
OctoCodingBench 是一个专注于评估编码代理指令遵循能力的基准数据集。它包含 72 个精心设计的实例,每个实例都伴有任务描述、系统提示和总计 2422 个可客观判定的检查项。与仅关注任务完成度的传统基准不同,该数据集特别强调代理在解决代码任务过程中是否严格遵守系统约束、项目规范、工具使用协议等多源指令。通过多维度、二值化的检查清单,它能够有效区分任务成功与规则遵循之间的差异,为代理的可靠性和可控性评估提供了更全面的视角。
deepseek-ai/Janus-Pro-7B
已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
openbmb/MiniCPM-V-4_5
已完整同步
MiniCPM-V 4.5 是一款基于 Qwen3-8B 和 SigLIP2-400M 构建的多模态大语言模型,总参数量为 8B。它在视觉语言能力上表现出色,在多项基准测试中平均得分超过 GPT-4o-latest 等主流模型,并支持高效的高帧率视频理解,通过 3D 重采样器实现 96 倍视频 token 压缩。该模型具备可控的快速与深度思考模式切换,以及强大的 OCR、文档解析和多语言处理能力,支持最高 1.8 百万像素的高分辨率图像输入,并提供了多种量化与推理方式以适配不同使用场景。
Wan-AI/Wan2.2-S2V-14B
已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
GSM8K-V 是一个纯视觉的多图像数学推理基准,旨在将传统文本数学应用题转化为视觉形式。它包含 1,319 个高质量的多场景问题(共 5,343 张图像),覆盖了从现实场景中提取的数学推理任务。该基准可用于评估视觉语言模型在理解图像、跨图像推理以及解决算术问题方面的能力。评测结果表明,即使是当前最强的模型,在视觉数学推理上也与文本任务存在显著差距,凸显了该领域仍有很大的提升空间。
VIBE(Visual & Interactive Benchmark for Execution)是一个专门用于评估大语言模型(LLM)在真实全栈软件开发中能力的基准数据集。它包含200个精心设计的任务,覆盖Web前端、科学模拟、原生Android、原生iOS和后端开发五个子集,每个任务都提供了自然语言需求描述。该数据集采用创新的“Agent-as-a-Verifier”(AaaV)评估范式,从执行能力、交互逻辑和视觉表现三个维度对生成的应用程序进行综合评分,旨在推动LLM从“0到1”构建可交付应用的能力。
Robust-R1 是一个面向退化感知推理的视觉问答数据集,基于 A-OKVQA 子集构建,包含 1 万条训练样本和 1 千条验证样本,旨在提升模型在复杂视觉退化场景下的鲁棒理解能力。
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
RYS-Qwen3.5-27B-FP8-S 是一个基于 Qwen3.5 的 27B 参数因果语言模型,采用 FP8 量化(块大小 128)以降低存储和推理开销,同时保持与原始模型几乎一致的性能。该模型集成了视觉编码器,支持图像到文本的多模态任务,原生上下文长度达 262,144 token,并可扩展至 1,010,000 token。架构上融合了 Gated Delta Networks 与稀疏混合专家(MoE),在高效推理的同时兼顾多模态理解、推理、代码生成和智能体能力。它经过大规模强化学习训练,并支持 201 种语言,适用于全球部署场景。
RYS-Qwen3.5-27B-FP8-M 是一个基于 Qwen3.5-27B 的 FP8 量化版本,拥有 27B 参数,采用细粒度 128 块大小的 FP8 量化,性能与原始模型几乎一致。它属于因果语言模型,并集成了视觉编码器,支持图像到文本的多模态任务。模型采用高效的 Gated Delta 网络与稀疏 MoE 混合架构,原生支持 262,144 令牌的上下文长度,并可扩展至约 100 万令牌。在训练中引入了可扩展的强化学习,覆盖 201 种语言,在推理、编码、智能体及视觉理解等方面表现出色。
RYS-Qwen3.5-27B-FP8-L 是基于 Qwen3.5-27B 的 FP8 量化版本,采用块大小为 128 的细粒度量化方法,性能与原始模型几乎一致。该模型融合了多模态学习与高效的混合架构,支持文本和图像输入,原生上下文长度可达 262,144 个token,并可通过扩展支持至超过 100 万 token。它在大规模强化学习训练中表现出色,覆盖 201 种语言,适用于多种复杂场景。
Skywork/Matrix-Game
已完整同步
Matrix-Game是一个大规模Minecraft数据集,包含细粒度的键盘和鼠标动作标注,专为训练交互式、物理基础的世界模型而设计。该数据集可配合17B参数的扩散模型,用于生成高质量、可控的游戏世界视频,并支持对场景演化进行精细控制。
MYZY-AI/Muyan-TTS
已完整同步
Muyan-TTS是一个面向播客应用的可训练文本转语音模型。它在超过10万小时的播客音频数据上进行了预训练,支持零样本高质量语音合成,并能通过短短几分钟的目标语音实现说话人自适应,从而灵活地定制个性化声音。
CoreCognition 是一个面向多模态大语言模型的核心知识基准数据集,源于发展认知科学中的12项基本能力。它包含1,423个多模态样本和80个概念挑战问题,涉及对象持久性、空间推理、计数等人类直觉中固有的核心能力,旨在评估模型在基础认知任务上的表现。
这个数据集包含多个AI模型在价值冲突场景下的响应,以及不同评判模型对合规性的评估。数据分为三个主要子集:默认子集提供六个精选的分歧场景,涵盖各模型间的高分歧情况;完整子集包含全部超过41万条场景;评判评估子集则收录了约1.5万条由三个评判模型对部分模型响应做出的合规性判断。每个样本都记录了查询文本、多个模型的响应及其在各价值维度上的立场分数,适合用于分析模型在价值权衡中的表现。
ByteDance/Q-Insight
已完整同步
Q-Insight 是一个专注于图像质量理解的视觉语言模型,通过视觉强化学习进行训练。它基于 Qwen2.5-VL-7B-Instruct 进行微调,采用 Apache-2.0 开源协议。该模型主要面向图像质量评估(IQA)、视频质量评估(VQA)以及 AIGC 内容的理解任务。
EduBench是一个面向教育场景的综合性评估基准数据集,专门用于衡量大语言模型在多样化教学任务中的表现。它覆盖了学生和教师两大视角,共包含十个子任务,如问答、纠错、情感支持、自动出题、评分与教案生成等。数据以JSONL格式提供,每条记录包含任务元信息、输入提示词,以及多个主流大模型的预测结果,便于研究者进行对比分析。