CoolFace
Datasetpublic

hoanghai2110/vi-pretrain-clean

Vietnamese Pretraining Dataset Bộ dữ liệu tiếng Việt chất lượng cao để pretrain mô hình ngôn ngữ từ đầu (from scratch). Mục tiêu: "ít mà vàng" — ít dữ liệu nhưng cực sạch. Thống kê Chỉ số Giá trị Tổng docs 511,198 Raw text ~0.69 GB Ước tính tokens ~230M tokens Nguồn 4 nguồn Nguồn dữ liệu Nguồn Docs Loại nội dung Wikipedia VI 378,895 Bách khoa toàn thư OPUS OpenSubtitles 84,021 Hội thoại, phụ đề phim OPUS… See the full description on the dataset page: https://huggingface.co/datasets/hoanghai2110/vi-pretrain-clean.

sourceHugging Facecc0-1.0updated 6mo agoView on Hugging Face
0likes282downloads
settings

This repository belongs to hoanghai2110 on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namevi-pretrain-clean
visibilitypublic
licencecc0-1.0
gatedno
ownerhoanghai2110
Account settings
hoanghai2110/vi-pretrain-clean · CoolFace