lvjianjin/AdvertiseGen 已完整同步
数据集描述
AdvertiseGen以商品网页的标签与文案的信息对应关系为基础构造,是典型的开放式生成任务,在模型基于key-value输入生成开放式文案时,与输入信息的事实一致性需要得到重点关注。
数据预览
任务描述:给定商品信息的关键词和属性列表kv-list,生成适合该商品的广告文案adv; 数据规模:训练集114k,验证集1k,测试集3k; 数据来源:清华大学CoAI小组; 数据样例:
{
"content": "上衣 牛仔布 白色 简约 刺绣 外套 破洞",
"summary": "简约而不简单的牛仔外套,白色的衣身十分百搭。衣身多处有做旧破洞设计,打破单调乏味,增加一丝造型看点。衣身后背处有趣味刺绣装饰,丰富层次感,彰显别样时尚。"
}
基线系统
本数据集提供的基线系统,基于百度提出的ERNIE-UNIMO统一模态预训练框架。在本次比赛的三个文本生成任务中,我们基于本基线使用的模型是UNIMO-text,是基于ERNIE-UNIMO框架在文本数据上预训练得到模型。
5 个文件
浏览文件数据集版权信息
本数据集的许可证为 Apache License 2.0。如有违反相关条款,请联系 WEHUB,我们将及时处理。
下载数据集
通过 WeHub CLI 下载当前数据集快照。下列命令会固定为当前页面展示的数据版本(如果页面提供版本)。文件字节由本机直连存储下载,浏览器不会签发或保存下载链接。
前置要求
需要 Node.js 18 及以上,以及 npm(或 npx)。
1. 安装 CLI
npm install -g wehub-cli@latest
2. 下载此数据集
wehub datasets download ds_ext_2be4cc12b5 --revision 61d280a4ab5f6c7fd0554e79b8f45c11f91b4ddd --output ./ds_ext_2be4cc12b5
若中断或部分失败,在同一目录重新执行同一命令即可续传。默认会校验 SHA-256。
免全局安装
npx --yes wehub-cli@latest datasets download ds_ext_2be4cc12b5 --revision 61d280a4ab5f6c7fd0554e79b8f45c11f91b4ddd --output ./ds_ext_2be4cc12b5
高级选项
以下为 wehub datasets download 已支持的参数示例:
强制重新下载,不复用已校验的本地文件
wehub datasets download ds_ext_2be4cc12b5 --revision 61d280a4ab5f6c7fd0554e79b8f45c11f91b4ddd --output ./ds_ext_2be4cc12b5 --overwrite
仅包含匹配路径
wehub datasets download ds_ext_2be4cc12b5 --revision 61d280a4ab5f6c7fd0554e79b8f45c11f91b4ddd --output ./ds_ext_2be4cc12b5 --include "*.jsonl"
排除匹配路径
wehub datasets download ds_ext_2be4cc12b5 --revision 61d280a4ab5f6c7fd0554e79b8f45c11f91b4ddd --output ./ds_ext_2be4cc12b5 --exclude "*.md"
提高并发下载数
wehub datasets download ds_ext_2be4cc12b5 --revision 61d280a4ab5f6c7fd0554e79b8f45c11f91b4ddd --output ./ds_ext_2be4cc12b5 --jobs 8
完整帮助:wehub datasets download --help