数据集

4 个数据集
已选筛选: PDF mit 清除所有筛选
UNO-Bench 可在线预览 已完整同步
UNO-Bench是一个统一的全模态模型基准测试,旨在评估单模态与全模态(视觉、音频、语言)的理解能力。它包含44种任务类型和5种模态组合,共1250个人工标注的全模态样本和2480个增强的单模态样本。该数据集特别适合中文真实场景,支持多选和创新的多步开放式问题,并借助通用评分模型实现高效自动评估。通过该基准,可以揭示全模态能力在弱模型上的瓶颈效应与强模型上的协同促进规律。
GITATTRIBUTESJPEGJPGMDMP3MP4PARQUETPDFPNGWAV MIT License 10 GiB 5735 个文件 WeHub 同步于 2026-08-07 02:56:56 +00:00
DeepSeek-R1T-Chimera 是一个开源模型,通过合并 DeepSeek-R1 和 DeepSeek-V3(0324)的权重而来,融合了 R1 的推理能力与 V3 的 token 效率。该模型采用 DeepSeek-MoE Transformer 架构,于 2025 年 4 月发布,适用于文本生成任务。
DEEPSEEKGITATTRIBUTESJPGJSONMDPDFPYSAFETENSORS MIT License 641 GiB 173 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
deepseek-ai/DeepSeek-V3.2 可在线预览 已完整同步
DeepSeek-V3.2 是一个在高效推理与智能代理能力上取得显著进展的模型。它通过三项关键技术突破实现了高性能:新型稀疏注意力机制(DSA)大幅降低长上下文场景的计算复杂度;可扩展的强化学习框架使其在竞赛推理任务中达到甚至超越 GPT-5,其中高算力变体 DeepSeek-V3.2-Speciale 在性能上超越 GPT-5,并与 Gemini-3.0-Pro 持平;大规模代理任务合成管道则让模型在工具使用场景中更好地融合推理能力,提升复杂交互环境下的泛化与合规性。该模型在 2025 年国际数学奥林匹克(IMO)和国际信息学奥林匹克(IOI)中均获得金牌级表现。
GITATTRIBUTESJSONJSONLMDPDFPNGPYSAFETENSORSTXT MIT License 441 GiB 192 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00