baicai003/Llama3-Chinese-dataset 已完整同步
介绍
Github: https://github.com/CrazyBoyM/llama3-Chinese-chat 该数据集已统一处理为firefly格式,可以配合firefly工具直接训练llama3中文模型。 特别推荐:新增DPO偏好对齐中文强化学习数据:https://modelscope.cn/datasets/shareAI/shareAI-Llama3-DPO-zh-en-emoji/summary
使用方法
本数据集可以在firefly框架上直接加载使用训练
直接使用
sft_zh_with_all.jsonl文件是包含所有清洗处理后数据集的合并文件,可以直接使用FireFly训练你的中文模型。(过滤后问答数据量约169万条)
按需使用
下面演示如何合并以及处理数据,你可以按照自己的需求对单点数据进行加强扩充。 首先,将所有数据集合并为一个jsonl文件:
cat *.jsonl > merged.jsonl
然后,使用check_jsonl.py对数据集进行校验, 去除格式错误的个别样本:
python3 check_jsonl.py
最后,使用change_info.py修改模型的身份认知信息:
python3 change_info.py
小建议:
- 如果觉得个别数据集质量不高,可以自行删除。
- 如果觉得个别数据集样本不够,可以自行添加。
- 如果觉得个别数据集样本太多,可以自行采样。 附如何随机采样一部分:
import json
import random
def sample_jsonl(input_file, output_file):
# 读取输入文件
with open(input_file, 'r', encoding='utf-8') as f:
lines = f.readlines()
# 随机采样1/100的数据
sample_size = len(lines) // 100
sampled_lines = random.sample(lines, sample_size)
# 写入输出文件
with open(output_file, 'w', encoding='utf-8') as f:
for line in sampled_lines:
f.write(line)
if __name__ == "__main__":
input_file = "./1_0_firefly_chinese_common_task_1649k.jsonl" # 输入文件路径
output_file = "sampled_chinese_common_task_16k.jsonl" # 输出文件路径
sample_jsonl(input_file, output_file)
23 个文件
浏览文件数据集版权信息
本数据集的许可证为 Apache License 2.0。如有违反相关条款,请联系 WEHUB,我们将及时处理。
通过 WeHub CLI 下载当前数据集快照。下列命令会固定为当前页面展示的数据版本(如果页面提供版本)。文件字节由本机直连存储下载,浏览器不会签发或保存下载链接。
前置要求
需要 Node.js 18 及以上,以及 npm(或 npx)。
1. 安装 CLI
npm install -g wehub-cli@latest
2. 下载此数据集
wehub datasets download ds_ext_95e8c00d22 --revision 7133ad2d04f7d19d05d450b0c2d40e138c9b0d24 --output ./ds_ext_95e8c00d22
若中断或部分失败,在同一目录重新执行同一命令即可续传。默认会校验 SHA-256。
免全局安装
npx --yes wehub-cli@latest datasets download ds_ext_95e8c00d22 --revision 7133ad2d04f7d19d05d450b0c2d40e138c9b0d24 --output ./ds_ext_95e8c00d22
高级选项
以下为 wehub datasets download 已支持的参数示例:
强制重新下载,不复用已校验的本地文件
wehub datasets download ds_ext_95e8c00d22 --revision 7133ad2d04f7d19d05d450b0c2d40e138c9b0d24 --output ./ds_ext_95e8c00d22 --overwrite
仅包含匹配路径
wehub datasets download ds_ext_95e8c00d22 --revision 7133ad2d04f7d19d05d450b0c2d40e138c9b0d24 --output ./ds_ext_95e8c00d22 --include "*.jsonl"
排除匹配路径
wehub datasets download ds_ext_95e8c00d22 --revision 7133ad2d04f7d19d05d450b0c2d40e138c9b0d24 --output ./ds_ext_95e8c00d22 --exclude "*.md"
提高并发下载数
wehub datasets download ds_ext_95e8c00d22 --revision 7133ad2d04f7d19d05d450b0c2d40e138c9b0d24 --output ./ds_ext_95e8c00d22 --jobs 8
完整帮助:wehub datasets download --help