数据集

5 个数据集
已选筛选: 多模态理解 清除所有筛选
Tongyi-DataEngine/SA1B-Dense-Caption 可在线预览 已完整同步
该数据集为SA-1B中的约863万张图片提供了高质量、详细的长文本中文描述。每张图片的描述包含整体场景概括和局部重要元素的细节说明,结构清晰,适合用于多模态模型训练、图像描述生成等任务。数据以Parquet格式组织,方便直接使用。
GITATTRIBUTESJSONMDPARQUET Apache License 2.0 280 GiB 727 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
THUDM/GLM-4.1V-9B-Thinking 已完整同步
GLM-4.1V-9B-Thinking 是一个面向推理增强的开源视觉语言模型,基于 GLM-4-9B-0414 构建,通过引入“思考范式”与强化学习显著提升了复杂任务的准确性与完整性。该模型在 10B 参数级别的视觉语言模型中达到领先水平,在 18 项基准测试上甚至超越 72B 参数的 Qwen-2.5-VL-72B。它支持长达 64k 的上下文、任意宽高比及最高 4K 图像分辨率,并具备中英双语能力,适用于数学推理、长上下文理解及多模态智能体等应用场景。
GITATTRIBUTESIPYNBJINJAJSONMDSAFETENSORS MIT License 19 GiB 15 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
deepseek-ai/Janus-Pro-7B 已完整同步
Janus-Pro 是一个统一的多模态理解与生成框架,通过解耦视觉编码路径,在保持单一统一 Transformer 架构的同时,缓解了视觉编码器在理解与生成任务中的冲突,提升了灵活性与性能。该模型基于 DeepSeek-LLM 构建,在理解任务中使用 SigLIP-L 视觉编码器(支持 384×384 图像输入),图像生成则采用下采样率为 16 的 tokenizer,在多项任务上达到或超越了专用模型的水平。
BINGITATTRIBUTESJSONMDPNG MIT License 14 GiB 13 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
RYS-Qwen3.5-27B-FP8-S 是一个基于 Qwen3.5 的 27B 参数因果语言模型,采用 FP8 量化(块大小 128)以降低存储和推理开销,同时保持与原始模型几乎一致的性能。该模型集成了视觉编码器,支持图像到文本的多模态任务,原生上下文长度达 262,144 token,并可扩展至 1,010,000 token。架构上融合了 Gated Delta Networks 与稀疏混合专家(MoE),在高效推理的同时兼顾多模态理解、推理、代码生成和智能体能力。它经过大规模强化学习训练,并支持 201 种语言,适用于全球部署场景。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 29 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
这是一个基于 Qwen3-VL-8B-Thinking 的 8 位量化模型,支持图像到文本的生成任务,例如描述图片内容。模型采用 MLX 格式,方便在 Apple 设备上高效运行。
GITATTRIBUTESJINJAJSONMDSAFETENSORSTXT Apache License 2.0 9.2 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00