数据集
142 个数据集
热门分类:
CoreCognition 是一个面向多模态大语言模型的核心知识基准数据集,源于发展认知科学中的12项基本能力。它包含1,423个多模态样本和80个概念挑战问题,涉及对象持久性、空间推理、计数等人类直觉中固有的核心能力,旨在评估模型在基础认知任务上的表现。
这个数据集包含多个AI模型在价值冲突场景下的响应,以及不同评判模型对合规性的评估。数据分为三个主要子集:默认子集提供六个精选的分歧场景,涵盖各模型间的高分歧情况;完整子集包含全部超过41万条场景;评判评估子集则收录了约1.5万条由三个评判模型对部分模型响应做出的合规性判断。每个样本都记录了查询文本、多个模型的响应及其在各价值维度上的立场分数,适合用于分析模型在价值权衡中的表现。
ByteDance/Q-Insight
已完整同步
Q-Insight 是一个专注于图像质量理解的视觉语言模型,通过视觉强化学习进行训练。它基于 Qwen2.5-VL-7B-Instruct 进行微调,采用 Apache-2.0 开源协议。该模型主要面向图像质量评估(IQA)、视频质量评估(VQA)以及 AIGC 内容的理解任务。
BAAI/Video-XL-2
已完整同步
Video-XL-2 是一个支持视频与文本交互的多模态模型,能够根据视频内容回答用户的问题。它针对长视频场景提供了两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层 KV 缓存解码(bi-level kvs decoding),可以有效降低显存占用和响应延迟,适合处理较长视频的推理任务。
这是一个基于 Qwen3-VL-8B-Thinking 的 8 位量化模型,支持图像到文本的生成任务,例如描述图片内容。模型采用 MLX 格式,方便在 Apple 设备上高效运行。
这是一个用于训练推理模型的数据集,包含可验证的数学和编程任务。数据集共有约28.5万条训练样本,每条样本包含问题ID、任务类型、提示文本、验证信息以及一个参考模型的解答率等字段。
这是一个基于 Qwen3-30B-A3B 的 GGUF 格式量化模型,支持 128K 上下文长度,采用 Unsloth Dynamic 2.0 量化技术,在保持较高精度的同时优化了运行效率。该模型可在 llama.cpp、Ollama 等框架中直接使用,并支持通过 `/think` 和 `/no_think` 指令在推理过程中切换模型的思考模式,方便多轮对话中的灵活控制。
LLaDA2.0-flash-preview 是一个基于扩散技术的语言模型,采用混合专家(MoE)架构,总参数量达1000亿,但推理时仅激活约61亿参数,显著降低了计算成本。它在代码生成、复杂数学推理以及工具调用等任务上表现突出,并在多个基准测试中展现出与同类开源模型相比更优的性能。该模型支持指令微调,适用于实际应用场景,未来还将通过强化学习进一步提升推理能力。
High_Dimensional_Time_Series 是多变量时间序列预测数据集,包含 M5、伦敦智能电表、Wikipedia 流量、全球温度和风速等序列配置。
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
cloudcatcher2/VCBench
已完整同步
VCBench 是一个标准化的视觉语言模型评估框架,专注于数学领域的问答任务。该数据集提供了标准评估和 GPT 辅助评估两种方式,帮助用户衡量模型在单选题和自然语言回答上的表现。评估脚本会输出整体准确率以及按问题类型细分的准确率,方便用户深入分析模型能力。
CipherBank 是一个专门用于评估大语言模型在密码解密任务中推理能力的基准数据集。它包含超过 2300 个精心设计的问题,覆盖 262 种不同的明文,涉及 5 个领域、14 个子领域,并整合了从经典密码到自定义加密方法的 3 大类共 9 种加密算法(如 Rot13、Atbash、Polybius、Vigenere 等)。这些问题聚焦于隐私敏感和真实世界的场景,旨在测试模型对加密数据的理解、操作与推理能力。
M3-Agent-Control 是一个面向智能体控制任务的数据集,采用 Apache-2.0 许可证。数据集包含模型权重(以 safetensors 格式存储)、结构化文本、二进制数据及纯文本等多种内容类型,适用于相关领域的模型训练与评估。
VeriWeb 是面向智能体信息检索的可验证长链网页任务基准,用于评估智能体在网页环境中的搜索、证据获取和结果验证能力。
TimesFM 是一个预训练的时间序列基础模型,专为时间序列预测任务设计。它采用仅解码器架构,在多种数据上进行了预训练,包括合成和增强数据。该模型支持 PyTorch 框架,能够处理最大上下文长度为1024、最大预测步长为256的时间序列,并提供输入归一化、连续分位数预测、翻转不变性等功能,适用于多种预测场景。
Qwen/Qwen3.5-397B-A17B
已完整同步
Qwen3.5-397B-A17B是一个大规模多模态语言模型,总参数量达3970亿,每个token仅激活约170亿参数。它采用高效的混合架构,融合Gated Delta Networks与稀疏混合专家(MoE),在视觉理解、推理、编码和智能体等任务上表现优异。该模型原生支持26万tokens上下文长度,并可扩展至百万级,同时覆盖201种语言,具备强大的多语言能力。通过扩展规模的强化学习训练和接近100%的多模态训练效率,它在保持高性能的同时实现了较低的推理成本。
这是一个用于多条件图形设计生成的大规模高质量数据集,包含约40万个合成样本。每个样本都带有丰富的多条件标注,涵盖主要视觉元素、次要视觉元素(附带空间与语义信息)以及文本元素(如标语或标题的布局信息)。该数据集适用于文本到图像生成等任务。
BAAI/bge-code-v1
已完整同步
BAAI/bge-code-v1 是一个基于大语言模型的代码嵌入模型,专注于代码检索、文本检索和多语言检索。它能够用中英文自然语言查询以及 20 种编程语言进行高效代码检索,同时保持与同等规模文本嵌入模型相当的文本检索能力,并支持英语、中文、日语、法语等多种语言。该模型基于 sentence-transformers 框架,采用 Apache-2.0 许可证。
Kwai-Keye/Keye-VL-1_5-8B
已完整同步
Kwai Keye-VL-1.5 是一款前沿的多模态大语言模型,专注于视频理解与推理。它采用了创新的“慢-快”视频编码策略,通过渐进式四阶段预训练方法将上下文长度扩展至128K tokens,并设计了全面的后训练流程,以增强推理能力和对齐人类偏好。该模型在视频理解任务上表现出显著提升,同时在其他多模态基准测试中保持竞争力。