数据集

3 个数据集
已选筛选: GZ apache-2.0 清除所有筛选
CASIA-LM/OpenS2S_Datasets 可在线预览 已完整同步
这是一个开放的数据集,包含中英文响应语音数据,采用 Apache 2.0 许可证。数据文件以 JSONL 和压缩包格式提供,支持下载后合并与提取,适合用于语音相关任务的研究与开发。
0123456GITATTRIBUTESGZJSONLMD Apache License 2.0 70 GiB 19 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
OpenAssistant/oasst1 可在线预览 已完整同步
这是一个大规模、多语言的对话数据集,由13,500多名志愿者众包构建而成。其中包含超过16万条人类编写的助手式对话消息,覆盖35种语言,并附有超过46万条质量评分。数据以对话树形式组织,每条消息包含角色(助手或提示者)、语言、审核结果、标签以及毒性评估等丰富字段,可用于训练和评估对话模型的对齐能力。
GITATTRIBUTESGZMDPARQUET Apache License 2.0 221 MiB 11 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xlangai/ubuntu_osworld_file_cache 可在线预览 已完整同步
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。
BIBBINCSSCSVDATADOCXEMLEPUBFILEGIFGITATTRIBUTESGZHTMLJPEGJPGJSONMDMP3MP4ODSODTPDFPNGPPTPPTXPYRAWSHSQLITESRTTEXTXTVSIXWAVWEBPWHLXCFXLSXLSXXZZIP Apache License 2.0 1.1 GiB 720 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00