datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
BAAI_OL-CChttps://data.baai.ac.cn/details/OL-CC
*更改成了ShareGPT格式,并且将10006个问题-回答对,以及1649个仅有问题的,分为两个json。
感谢北京智源人工智能研究院(BAAI)的工作,但是似乎openlabel.baai.ac.cn和原图床已经下线,并且抱抱脸上的BAAI并未收录这个宝贵的数据集,所以在这里另存了一份。
--Below is original README--
OpenLabel-Chinese Conversations Dataset (OL-CC) 是首个以众包方式、人工生成的开源中文对话指令集,基于 openlabel.baai.ac.cn 开放平台进行数据收集,包含 10k+ “指令-回答”数据对和 1.6k+ 人工指令数据。指令类型丰富,包括问答任务、文本写作、文本抽取、编辑改写、分类选择、头脑风暴、 闲聊对话、逻辑&数学等任务。
截至目前,已有 276 位志愿者参与了数据集的建设。志愿者完成了以下任务:a) 扮演人类用户向AI助手发出指令,b)… See the full description on the dataset page: https://huggingface.co/datasets/lorinma/BAAI_OL-CC.BookBasedQAGen_Petrochemical如果你有领域相关的一些文本材料(可以是OCR出来还比较脏的数据),想转化成单轮 alpaca 形式的的QA对,这是一个简易的教程。也就图一乐,因为真正高质量的领域QA还是得来自于行业专家,并且向LLM注入领域知识应该通过pretrain而不是SFT也已经是共识了。
bookgen文件夹中包含了样例文本和py文件,注意prompt根据领域调整一下,即使原始语料比较脏LLM也基本可以理解。并没有核查过会不会出现幻觉现象。
只要是和OpenAI SDK兼容的API服务都可以平滑迁移。这里使用了零一万物的yi-large API。https://platform.lingyiwanwu.com/
2024年8月2日更新,更新OpenAI SDK 1.0的调用方式,更新使用yi-large API,更新为单线程模式。
⚠️注意,单线程模式是为了更好的debug,真正生成数据需要自己修改成多线程模式,并且rate limit并没有单独进行handle。
样例数据是于23年6月使用3.5-turbo生成的,只放了一部分,随便玩玩就好~
If you have some text… See the full description on the dataset page: https://huggingface.co/datasets/lorinma/BookBasedQAGen_Petrochemical.Slim-COIG-Kun
This is a Slim version of COIG-Kun
因为原始的数据集有53万条之多,所以进行了subsample。
采样方法大致为,使用bert-base-chinese将Instruction转换为embedding,使用类knn的方法抽取了1万条。并转换成了sharegpt格式。
为了更直观的查看效果,文件中还有一个仅采样了1千条的版本。采样前后的Embedding使用tsne进行可视化。
original Kun(蓝色)和Moss003(红色)的区别,是否可解读为虽然Kun的数量很高,但是首个instruction的语义多样化不如Moss。(后记:这个地方不应该用tsne的,类见应该用umap不过anyway凑活着看吧是那个意思
Akka_Finetuning_Llama3.2
