CoolFace
Datasetpublic

erhwenkuo/firefly-train-chinese-zhtw

Dataset Card for "firefly-train-chinese-zhtw" 資料集摘要 本資料集主要是應用於專案:Firefly(流螢): 中文對話式大語言模型 ,經過訓練後得到的模型 firefly-1b4。 [Firefly(流螢): 中文對話式大語言模型]專案(https://github.com/yangjianxin1/Firefly)收集了 23 個常見的中文資料集,并且對於每種不同的 NLP 任務,由人工書寫若干種指令模板來保證資料的高品質與豐富度。 資料量為115萬 。數據分佈如下圖所示: 訓練資料集的 token 長度分佈如下圖所示,絕大部分資料的長度都小於 600: 原始資料來源: YeungNLP/firefly-train-1.1M Firefly(流萤): 中文对话式大语言模型 資料下載清理 下載 chinese-poetry: 最全中文诗歌古典文集数据库 的 Repo 使用 OpenCC 來進行簡繁轉換 使用 Huggingface… See the full description on the dataset page: https://huggingface.co/datasets/erhwenkuo/firefly-train-chinese-zhtw.

sourceHugging Faceupdated 3y agoView on Hugging Face
2likes142downloads
7 commits on main
d4af0aa3y ago

update image

erhwenkuo
bbfa58a3y ago

Update README.md

erhwenkuo
e27766b3y ago

Upload README.md with huggingface_hub

erhwenkuo
1bc4b8f3y ago

Upload data/train-00002-of-00003-05e6f5df7f1305d5.parquet with huggingface_hub

erhwenkuo
c4fbb413y ago

Upload data/train-00001-of-00003-af18d33f09b1768f.parquet with huggingface_hub

erhwenkuo
9b292533y ago

Upload data/train-00000-of-00003-d99833ac0e37d473.parquet with huggingface_hub

erhwenkuo
b913ec43y ago

initial commit

erhwenkuo