数据集

2 个数据集
已选筛选: 自然语言处理 TXT MIT 清除所有筛选
BAAI/bge-small-en-v1.5 已完整同步
这是一个轻量级的英文句子嵌入模型,属于bge系列,能够将文本转换为向量表示,适用于特征提取、句子相似度计算和语义搜索等任务。它在多个自然语言处理基准测试中表现出色,涵盖分类、检索、聚类、重排序和语义文本相似度等场景,兼顾了效率与性能。
BINGITATTRIBUTESJSONMDONNXSAFETENSORSTXT MIT License 382 MiB 14 个文件 WeHub 同步于 2026-08-20 02:03:46 +00:00
liwu/MNBVC 可在线预览 已完整同步
MNBVC 是一个大规模中文语料数据集,由社区持续整理和更新。它包含多个子集,覆盖学术论文、博客、书籍、企业年报、法律判决书、代码等多种文本类型,适用于文本生成、掩码语言建模等自然语言处理任务。数据集以高质量的中文互联网文本为主,旨在为研究和应用提供丰富的语料资源。
GITATTRIBUTESGZMDPARQUETPYTXTZIP MIT License 3.3 TiB 24126 个文件 WeHub 同步于 2026-08-05 08:09:00 +00:00