数据集

4 个数据集
已选筛选: GZ MIT 数据集 清除所有筛选
Anthropic/hh-rlhf 已完整同步
HH-RLHF数据集包含两类数据:一类是人类偏好数据,用于训练偏好或奖励模型,以支持基于人类反馈的强化学习(RLHF),重点关注助手的帮助性和无害性;另一类是红队测试对话数据,记录了人类与AI的对抗性对话,并附有对对话危害性的标注。这些数据仅供研究使用,不适用于直接训练对话代理,因为可能引发有害行为。数据中可能包含冒犯性或令人不适的内容。
GITATTRIBUTESGZMD MIT License 90 MiB 11 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
wormtooth/MNBVC-judgment 已完整同步
MNBVC-judgment 是中文裁判文书语料,采用 MNBVC 通用数据格式并以压缩文件提供,适合用于法律文本处理与中文语言模型研究。
GITATTRIBUTESGZMD MIT License 116 GiB 996 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00