数据集

15 个数据集
已选筛选: PY 数据集 清除所有筛选
yiliu666/xiaoduan 已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
APKDMGEXEGITATTRIBUTESHTMLJSJSONMDPCKPDFPKGPNGPYTXTWASMZIP Apache License 2.0 3.8 GiB 63 个文件 WeHub 同步于 2026-08-22 18:38:19 +00:00
modelscope/mmlu 已完整同步
该数据集目前处于预发布阶段,采用 Apache License 2.0 许可协议。内容涵盖文本、二进制、结构化文本和归档等多种类型,以 Markdown、JSON、Python 脚本及 TAR 归档等格式提供。
GITATTRIBUTESJSONMDPYTAR Apache License 2.0 159 MiB 6 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
该数据集是一个用于图像描述(image captioning)任务的数据集,包含训练和验证两个子集。每条数据由图像、对应的描述文本以及图像ID组成,适合用于训练和评估图像描述模型。数据集规模在10k到1m之间,语言为英文。
JSONMDPY Apache License 2.0 7.6 KiB 3 个文件 WeHub 同步于 2026-08-20 09:19:36 +00:00
CMMLU 是中文大规模多任务语言理解评测集,覆盖多个知识学科和任务类别,通过中文多项选择题评估模型的知识与理解能力。
MDPYZIP Apache License 2.0 1.0 MiB 3 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
baicai003/Llama3-Chinese-dataset 可在线预览 已完整同步
这是一个为训练Llama3中文模型而整合的多源指令微调数据集。它融合了英文通用指令、中文知乎问答、ShareGPT对话、中文常识任务、成语、诗词、逻辑推理、小红书风格文本等多种数据,并统一处理为firefly格式,便于直接训练。数据集包含约169万条清洗后的问答对,支持按需选择子集或合并使用,适合用于提升模型的中文理解和生成能力。
GITATTRIBUTESJSONLMDPY Apache License 2.0 4.0 GiB 23 个文件 WeHub 同步于 2026-08-20 02:08:19 +00:00
modelscope/gsm8k 已完整同步
GSM8K 是小学数学文字题与解答资源,当前镜像包含 JSON、脚本和说明文件,适合数学推理训练样例、模型评测和教育研究。
JSONMDPY Apache License 2.0 6.2 KiB 3 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
opencompass/mmlu 可在线预览 已完整同步
MMLU(大规模多任务语言理解)是一个涵盖57个学科的多选题数据集,用于评估语言模型在广泛知识领域的理解能力。数据集包含问题、四个选项和正确答案,覆盖从抽象代数、天文学到临床知识等众多领域,提供了测试集、验证集和开发集等划分。
GITATTRIBUTESJSONMDPARQUETPYTAR Apache License 2.0 258 MiB 181 个文件 WeHub 同步于 2026-08-19 14:18:20 +00:00
本数据集收录了高校录取分数和位次信息,字段齐全、数据规模充足,适合用于高校招生与录取相关分析。使用时需注意按派生或索引口径进行处理。数据提供 JSON、CSV 等多种格式。
CSVGITIGNOREJSJSONMDPY 104 MiB 2712 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
这是一个从ShareGPT对话中精选的英文对话数据集,经过严格清洗得到约5.3万条高质量样本。清洗过程移除了非英语内容、大量重复字符,并过滤掉了包含常见“AI道德说教”短语的对话,旨在减少模型训练中的安全拒绝倾向。数据集提供两个版本,其中一个额外去掉了含有“I'm sorry, but”的实例,使用者可根据需求选择。适合用于训练开放、少限制的对话模型。
GITATTRIBUTESIPYNBJSONMDPYWHL Apache License 2.0 4.0 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cais/mmlu 可在线预览 已完整同步
MMLU 是英文多任务语言理解评测集,覆盖抽象代数、法律、医学、计算机科学等多个学科,以多项选择题评估模型的知识与推理能力。
GITATTRIBUTESJSONMDPARQUETPYTAR MIT License 258 MiB 181 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
IWR-Bench/IWR-Bench 可在线预览 已完整同步
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
BMPGIFGITATTRIBUTESJPGJSONLMDMP4PNGPYSVGWEBP Apache License 2.0 2.5 GiB 9779 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00