数据集

4 个数据集
已选筛选: IPYNB 清除所有筛选
THUDM/GLM-4.1V-9B-Thinking 已完整同步
GLM-4.1V-9B-Thinking 是一个面向推理增强的开源视觉语言模型,基于 GLM-4-9B-0414 构建,通过引入“思考范式”与强化学习显著提升了复杂任务的准确性与完整性。该模型在 10B 参数级别的视觉语言模型中达到领先水平,在 18 项基准测试上甚至超越 72B 参数的 Qwen-2.5-VL-72B。它支持长达 64k 的上下文、任意宽高比及最高 4K 图像分辨率,并具备中英双语能力,适用于数学推理、长上下文理解及多模态智能体等应用场景。
GITATTRIBUTESIPYNBJINJAJSONMDSAFETENSORS MIT License 19 GiB 15 个文件 WeHub 同步于 2026-08-12 04:26:38 +00:00
这是一个从ShareGPT对话中精选的英文对话数据集,经过严格清洗得到约5.3万条高质量样本。清洗过程移除了非英语内容、大量重复字符,并过滤掉了包含常见“AI道德说教”短语的对话,旨在减少模型训练中的安全拒绝倾向。数据集提供两个版本,其中一个额外去掉了含有“I'm sorry, but”的实例,使用者可根据需求选择。适合用于训练开放、少限制的对话模型。
GITATTRIBUTESIPYNBJSONMDPYWHL Apache License 2.0 4.0 GiB 14 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
xbench/AgentIF-OneDay 可在线预览 已完整同步
AgentIF-OneDay 是一个专为评估通用 AI 代理在日常场景中指令跟随能力而设计的基准测试集。它包含 104 个真实感任务,覆盖工作、生活和学习三大领域,强调代理需要处理复杂附件、理解隐含指令并生成具体文件输出。任务类型包括开放工作流执行、潜在指令推断和迭代优化,每个任务均配有详细的评分标准与预期完成时间,适合用于全面衡量代理在多样化日常需求上的表现。
CSVDOCDOCXGITATTRIBUTESGZHTMLIPYNBJPEGJPGJSONJSONLMDPDFPNGPPTXPYSRTTEXTXTXLSXLSXZIP MIT License 304 MiB 180 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00
E-commerce Orders Dataset 2026 | SCRA 可在线预览 已完整同步
该数据集包含30,000条电商订单记录,涵盖客户画像、订单详情、产品信息、定价结构、折扣、支付方式、物流操作、客户互动、评分和利润指标等41个特征,数据完整无缺失。适用于商业智能、客户分析、销售绩效评估及机器学习任务,可支持高价值订单分类、订单金额预测和退货预测等场景。
CSVIPYNB MIT License 7.4 MiB 3 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00