数据集

16 个数据集
已选筛选: PNG apache-2.0 数据集 清除所有筛选
CAM++ 说话人确认模型基于密集连接时延神经网络,专为中文通用场景设计,在约 200k 说话人的大规模数据集上训练而成。该模型在说话人识别任务中兼顾高性能与高效率,相比主流模型(如 ResNet34、ECAPA-TDNN)在准确率与推理速度上均有优势,可广泛用于说话人确认、说话人日志、语音合成及说话人风格转换等场景。
BINGITATTRIBUTESJSONMDPNGTXTWAVYAML Apache License 2.0 28 MiB 12 个文件 WeHub 同步于 2026-08-30 00:33:31 +00:00
yiliu666/xiaoduan 已完整同步
该数据集包含了小端AI助手的多个版本安装包、本地模型文件及相关资料。小端AI是一款运行在Windows和macOS上的智能助手,支持语音和文字交互,具备永久记忆、视频识别、图片识别、音频识别、自我进化等能力,并能接入QQ、飞书等平台实现语音对话与控制。数据集中的版本包括mac测试版、Windows正式版及测试版,并提供了适配不同硬件配置的本地模型(如35B和9B的GGUF文件),方便用户按需选择。此外,还包含配置文件、说明文档等,适用于希望自部署或二次开发AI助手的用户。
APKDMGEXEGITATTRIBUTESHTMLJSJSONMDPCKPDFPKGPNGPYTXTWASMZIP Apache License 2.0 3.8 GiB 63 个文件 WeHub 同步于 2026-08-22 18:38:19 +00:00
基于语义关联的人像和服饰关键点 可在线预览 已完整同步
这个数据集是为虚拟试衣任务构建的,包含在VITON-HD、VITON和DressCode(上装部分)三个开源数据集图片上重新标注的语义关联关键点。每个数据集均由服饰平铺图片和人像图片组成,其中语义关联的关键点对将人像与服饰的局部语义对应起来。标注采用统一规则,适用于不同款式的服饰,确保相同序号的关键点在不同类型服饰上具有一致语义。每张图片标注了32个关键点,并附带可见、遮挡、不存在三种互斥属性,标注结果以pkl文件格式存储。
CSVJSONMDPNG Apache License 2.0 25 MiB 10 个文件 WeHub 同步于 2026-08-22 04:58:19 +00:00
魔搭通用SFT数据集 可在线预览 已完整同步
魔搭通用SFT数据集是MSAgent-Bench的一个子集,主要涵盖通用问答场景下的监督微调(SFT)数据。每条样本包含一个唯一标识符和对话内容,对话由system、user、assistant三种角色组成,system用于设定模型前置人设,user为用户的输入,assistant为模型的回复。该数据集适用于工具学习、API调用等任务场景,有助于提升模型在复杂交互中的表现。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 514 MiB 5 个文件 WeHub 同步于 2026-08-20 15:13:43 +00:00
MSAgent-Bench-中文Agent数据集 可在线预览 已完整同步
MSAgent-Bench 是一个面向中文 Agent 场景的数据集,旨在提升开源大语言模型作为中枢,集成并调用多种 AI 模型能力。该数据集包含约 60 万条训练样本和对应的验证样本,涵盖 AI 模型 API、通用 API、与 API 无关的通用 SFT 数据以及 API 检索增强数据。数据格式为每行一个 JSON 样本,包含 `id` 和 `conversations` 字段,其中 `conversations` 由 `system`、`user` 和 `assistant` 三种角色组成,用于模拟模型在插件调用、工具学习和多轮对话中的交互行为。
GITATTRIBUTESJSONJSONLMDPNG Apache License 2.0 2.1 GiB 6 个文件 WeHub 同步于 2026-08-20 09:08:13 +00:00
builddotai/Egocentric-10K 已完整同步
Egocentric-10K 是目前规模最大的以自我为中心视角的数据集,也是首个完全在真实工厂环境中采集的数据。它包含超过 10,000 小时、约 10.8 亿帧的视频素材,共 192,900 个视频片段,中位时长为 180 秒。视频采用 H.265 编码的 1080p 分辨率,帧率 30 fps,由单目头戴摄像机拍摄,视野为 128° 水平、67° 垂直。数据以 WebDataset 格式存储,每个 tar 包中视频与 JSON 元数据成对出现,并提供基于 OpenCV 鱼眼模型的相机内参。该数据集覆盖 85 个工厂中的多名工人,在手部可见性和主动操作密集度方面达到了当前最优水平。
GITATTRIBUTESJSONMDPNGTAR Apache License 2.0 16 TiB 21645 个文件 WeHub 同步于 2026-08-20 03:33:46 +00:00
这是一个高质量的中文预训练语料数据集,专门面向教育领域,包含约9000万条经过严格筛选的文本,总数据量约300GB。该数据集采用类似Fineweb-Edu的构建方法:先利用评分模型评估样本的教育价值,再训练BERT模型对原始数据进行打分,仅保留评分高于4的数据,最后通过MinHash算法进行去重,确保内容质量高、多样性强且无冗余。它适用于中文自然语言处理中的文本生成等任务,尤其适合教育场景下的模型训练和微调。
GITATTRIBUTESMDPARQUETPDFPNGWEBP Apache License 2.0 290 GiB 310 个文件 WeHub 同步于 2026-08-20 02:03:45 +00:00
中文Text2SQL数据集 可在线预览 已完整同步
这是一个中文Text2SQL训练数据集,包含500条训练样本和100条测试样本,可用于训练和评估表格问答预训练模型。数据集支持中文,覆盖通用领域,能够帮助模型理解自然语言问题并生成对应的SQL查询语句。
CSVJSONMDPNG Apache License 2.0 1.3 MiB 6 个文件 WeHub 同步于 2026-08-19 14:58:20 +00:00
IWR-Bench/IWR-Bench 可在线预览 已完整同步
IWR-Bench 是一个专门用于评估多模态大语言模型(LVLMs)从用户交互视频中重建交互式网页能力的基准数据集。它包含近千条样本,每条样本带有详细的元信息,如交互复杂度、视觉复杂度、领域与子领域分类、录屏环境、动作序列(包括类型、参数、视觉评估标志等)以及对应的视频路径。该数据集主要面向视频理解与视觉问答任务,能够有效检验模型在理解用户操作意图并生成对应代码或结构化描述方面的表现。
BMPGIFGITATTRIBUTESJPGJSONLMDMP4PNGPYSVGWEBP Apache License 2.0 2.5 GiB 9779 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
alibaba-pai/OmniThoughtV_Filter_0.5M 可在线预览 已完整同步
OmniThoughtV是一个大规模多模态长思维链数据集,经过精心筛选后包含约50万条高质量样本。该数据集专注于提升模型的逐步推理能力,在视觉问答、数学推理等复杂任务上表现突出。通过微调,可以显著增强小模型的推理性能,使其在多个视觉理解与推理基准上取得更好的效果。
GITATTRIBUTESMDPARQUETPNGPY Apache License 2.0 99 GiB 32 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
cloudcatcher2/VCBench 已完整同步
VCBench 是一个标准化的视觉语言模型评估框架,专注于数学领域的问答任务。该数据集提供了标准评估和 GPT 辅助评估两种方式,帮助用户衡量模型在单选题和自然语言回答上的表现。评估脚本会输出整体准确率以及按问题类型细分的准确率,方便用户深入分析模型能力。
GITATTRIBUTESJSONMDPNG Apache License 2.0 99 MiB 8423 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
VeriWeb 是面向智能体信息检索的可验证长链网页任务基准,用于评估智能体在网页环境中的搜索、证据获取和结果验证能力。
GITATTRIBUTESJSONMDMP4PNG Apache License 2.0 80 GiB 609 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
PG23/Mobile-R1 可在线预览 已完整同步
Mobile-R1 是一个面向移动端 GUI 代理的中文轨迹数据集,包含从用户指令到完整交互过程的记录。每个样本由应用名称、指令文本、系统提示和一系列操作步骤组成,步骤中保存了对应屏幕截图、模型推理、子任务描述以及具体的执行动作(如点击、滑动、输入、等待等),并标注了屏幕尺寸用于坐标对齐。该数据集可用于训练和评估多模态模型在真实手机界面上的任务理解与操作生成能力。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 7.8 GiB 3927 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
wenge-research/yayi_uie_sft_data 可在线预览 已完整同步
该数据集是一个百万级的中英文混合语料,中文占比54%,英文占比46%,覆盖金融、社会、生物、商业、工业制造、化学、车辆、科学、疾病医疗、个人生活、安全和通用等12个领域,适用于数百个使用场景。数据主要支持三种信息抽取任务:命名实体识别(NER)涵盖中文28种实体类型和英文130种实体类型;关系抽取(RE)涵盖中文232种关系和英文236种关系;事件抽取(EE)涵盖中文84种事件类型和203种论元,以及英文45种事件类型和62种论元。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 3.1 GiB 10 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
m-a-p/FineFineWeb 可在线预览 已完整同步
FineFineWeb 是一个大规模英文网页语料库,专注于细粒度领域的文本分类与生成。该数据集覆盖了航空航天、农学、艺术、计算机科学、经济学、健康、法律等数十个领域,总计超过1万亿 token。通过多次迭代处理,它提供了丰富的结构化文本,适用于文本分类、文本生成和文本到文本生成等多种自然语言处理任务。
GITATTRIBUTESJSONLMDPNG Apache License 2.0 21 TiB 66109 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00