CoolFace
Datasetpublic

hoanghai2110/vi-pretrain-clean

Vietnamese Pretraining Dataset Bộ dữ liệu tiếng Việt chất lượng cao để pretrain mô hình ngôn ngữ từ đầu (from scratch). Mục tiêu: "ít mà vàng" — ít dữ liệu nhưng cực sạch. Thống kê Chỉ số Giá trị Tổng docs 511,198 Raw text ~0.69 GB Ước tính tokens ~230M tokens Nguồn 4 nguồn Nguồn dữ liệu Nguồn Docs Loại nội dung Wikipedia VI 378,895 Bách khoa toàn thư OPUS OpenSubtitles 84,021 Hội thoại, phụ đề phim OPUS… See the full description on the dataset page: https://huggingface.co/datasets/hoanghai2110/vi-pretrain-clean.

sourceHugging Facecc0-1.0updated 6mo agoView on Hugging Face
0likes282downloads
7 commits on main
4a5889b6mo ago

Add vi_pretrain_part_05.jsonl

hoanghai2110
5f9a4536mo ago

Add vi_pretrain_part_04.jsonl

hoanghai2110
040c4fa6mo ago

Add vi_pretrain_part_03.jsonl

hoanghai2110
2ff75f86mo ago

Add vi_pretrain_part_02.jsonl

hoanghai2110
73566916mo ago

Add vi_pretrain_part_01.jsonl

hoanghai2110
f296e476mo ago

Add dataset card

hoanghai2110
1fb470f6mo ago

initial commit

hoanghai2110