数据集

17 个数据集
已选筛选: PY apache-2.0 清除所有筛选
yiliu666/xiaoduan 已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
APKDMGEXEGITATTRIBUTESHTMLJSJSONMDPCKPDFPKGPNGPYTXTWASMZIP Apache License 2.0 3.8 GiB 63 个文件 WeHub 同步于 2026-08-22 18:38:19 +00:00
CMMLU 是中文大规模多任务语言理解评测集,覆盖多个知识学科和任务类别,通过中文多项选择题评估模型的知识与理解能力。
MDPYZIP Apache License 2.0 1.0 MiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
这是一个从ShareGPT对话中精选的英文对话数据集,经过严格清洗得到约5.3万条高质量样本。清洗过程移除了非英语内容、大量重复字符,并过滤掉了包含常见“AI道德说教”短语的对话,旨在减少模型训练中的安全拒绝倾向。数据集提供两个版本,其中一个额外去掉了含有“I'm sorry, but”的实例,使用者可根据需求选择。适合用于训练开放、少限制的对话模型。
GITATTRIBUTESIPYNBJSONMDPYWHL Apache License 2.0 4.0 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-SALA 已完整同步
MiniCPM-SALA是一种创新的大规模混合注意力模型,首次将稀疏注意力与线性注意力高效融合,专为百万级令牌的上下文建模设计。它采用25%的稀疏注意力层(基于InfLLM-v2)和75%的线性注意力层(Lightning Attention),在保持高保真长上下文建模能力的同时,突破了计算和内存瓶颈,实现了3.5倍的推理加速,并显著降低KV缓存开销。通过混合位置编码(HyPE)和基于蒸馏的HALO训练策略,该模型能够扩展到百万令牌以上的上下文长度,同时在通用知识、数学和代码等任务上保持与全注意力模型相当的性能。
GITATTRIBUTESJSONMDMODELPYSAFETENSORS Apache License 2.0 18 GiB 15 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
openbmb/MiniCPM-V-4_5 已完整同步
MiniCPM-V 4.5 是一款基于 Qwen3-8B 和 SigLIP2-400M 构建的多模态大语言模型,总参数量为 8B。它在视觉语言能力上表现出色,在多项基准测试中平均得分超过 GPT-4o-latest 等主流模型,并支持高效的高帧率视频理解,通过 3D 重采样器实现 96 倍视频 token 压缩。该模型具备可控的快速与深度思考模式切换,以及强大的 OCR、文档解析和多语言处理能力,支持最高 1.8 百万像素的高分辨率图像输入,并提供了多种量化与推理方式以适配不同使用场景。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 16 GiB 23 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Wan-AI/Wan2.2-S2V-14B 已完整同步
Wan2.2-S2V-14B 是一个音频驱动的电影级视频生成模型,能够根据输入音频生成具有丰富表现力的角色动画。它专注于处理复杂场景,如人物互动、自然身体动作和动态镜头运动,适用于影视制作等高品质需求。模型采用混合专家(MoE)架构,在保持计算效率的同时扩大了模型容量,并经过精心筛选的审美数据训练,可生成具有可控光影、构图和色彩风格的电影感视频。
BINBINARYGITATTRIBUTESJSONMDMODELMP4MSCMSGPACKMVPNGPTHPYSAFETENSORSSHTXT Apache License 2.0 46 GiB 49 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
IWR-Bench/IWR-Bench 可在线预览 已完整同步
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
BMPGIFGITATTRIBUTESJPGJSONLMDMP4PNGPYSVGWEBP Apache License 2.0 2.5 GiB 9779 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/Video-XL-2 已完整同步
Video-XL-2 是一个支持视频与文本交互的多模态模型,能够根据视频内容回答用户的问题。它针对长视频场景提供了两种效率优化策略:基于分块的预填充(chunk-based prefill)和双层 KV 缓存解码(bi-level kvs decoding),可以有效降低显存占用和响应延迟,适合处理较长视频的推理任务。
BINGITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 15 GiB 27 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
LLaDA2.0-flash-preview 是一个基于扩散技术的语言模型,采用混合专家(MoE)架构,总参数量达1000亿,但推理时仅激活约61亿参数,显著降低了计算成本。它在代码生成、复杂数学推理以及工具调用等任务上表现突出,并在多个基准测试中展现出与同类开源模型相比更优的性能。该模型支持指令微调,适用于实际应用场景,未来还将通过强化学习进一步提升推理能力。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 52 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
BAAI/bge-code-v1 已完整同步
BAAI/bge-code-v1 是一个基于大语言模型的代码嵌入模型,专注于代码检索、文本检索和多语言检索。它能够用中英文自然语言查询以及 20 种编程语言进行高效代码检索,同时保持与同等规模文本嵌入模型相当的文本检索能力,并支持英语、中文、日语、法语等多种语言。该模型基于 sentence-transformers 框架,采用 Apache-2.0 许可证。
GITATTRIBUTESJSONMDPYSAFETENSORSTXT Apache License 2.0 5.8 GiB 17 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
Kwai-Keye/Keye-VL-1_5-8B 已完整同步
Kwai Keye-VL-1.5 是一款前沿的多模态大语言模型,专注于视频理解与推理。它采用了创新的“慢-快”视频编码策略,通过渐进式四阶段预训练方法将上下文长度扩展至128K tokens,并设计了全面的后训练流程,以增强推理能力和对齐人类偏好。该模型在视频理解任务上表现出显著提升,同时在其他多模态基准测试中保持竞争力。
GITATTRIBUTESJPEGJSONMDPNGPYSAFETENSORSTXT Apache License 2.0 16 GiB 36 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
0xSero/GLM-4.7-185B-W4A16 已完整同步
GLM-4.7-185B-W4A16 是一个经过 4 比特权重量化(W4A16)的混合专家(MoE)模型,基于 GLM-4.7-185B 压缩而来。模型总参数量为 1850 亿,采用 INT4 权重与 FP16 激活的格式,磁盘占用约 99 GB,适用于文本生成任务。该量化版本在保持模型能力的同时显著降低了存储和推理时的显存需求。
GITATTRIBUTESJINJAJSONMDPYSAFETENSORS Apache License 2.0 92 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-21BA3B-Instruct 是一个面向本地部署的混合专家(MoE)语言模型,专为资源受限环境设计。它采用两级稀疏结构(细粒度 MoE 与稀疏前馈网络)和预注意力路由机制,有效降低计算需求并隐藏存储延迟。模型支持在普通 CPU 上以超过 20 tokens/s 的速度运行,内存占用仅约 8GB(Q4_0 量化)。在 MMLU、GPQA、MATH-500 等多项基准测试中,该模型取得了具有竞争力的性能,平均分达 76.26,超越了部分同规模及更大模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORS Apache License 2.0 40 GiB 21 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
SmallThinker-4BA0.6B-Instruct 是一个专为本地部署设计的高效语言模型,采用两层稀疏结构(细粒度混合专家与稀疏前馈网络),在降低计算需求的同时保持模型能力。该模型还引入了预注意力路由器和 NoPE-RoPE 混合稀疏注意力机制,以优化存储 I/O 和内存效率,在普通消费级 CPU 上即可实现每秒超过 20 个 token 的生成速度,内存占用仅约 1GB。模型主要面向英文文本生成任务,在多项基准测试中表现优于同规模的其他模型。
GITATTRIBUTESJSONMDPTPYSAFETENSORSTXT Apache License 2.0 8.0 GiB 16 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
MedAIBase/AntAngelMed 已完整同步
AntAngelMed 是当前最大的开源医疗语言模型,由浙江省卫健委、蚂蚁集团及浙江省安诊儿医学人工智能科技有限公司联合研发。它在 OpenAI 的 HealthBench 和中文权威评测 MedAIBench 上均取得领先成绩,尤其在 Hard 子集上表现突出。该模型采用高效 MoE 架构,总参数 100B 但仅激活 6.1B,推理速度可达 200 tokens/s 以上,同时支持 128K 上下文长度。通过医学语料持续预训练、高质量指令微调及 GRPO 强化学习,模型具备了深入的医学知识、严谨的诊断推理能力以及良好的安全伦理遵循。
GITATTRIBUTESJSONMDPYSAFETENSORS Apache License 2.0 192 GiB 35 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00