CoolFace
Datasetpublic

aitf-komdigi/EOS-Continued-Pretraining-Dataset

EOS Continued Pre-Training Dataset (Indonesia) Deskripsi Dataset EOS Continued Pre-Training Dataset adalah korpus teks bahasa Indonesia berskala besar (~214.2 Juta Token) yang dikurasi secara khusus untuk proses Continued Pre-Training (CPT) pada Large Language Models (LLM). Dataset ini disusun sebagai bagian dari program Artificial Intelligence Talent Factory (AITF), kolaborasi antara Kementerian Komunikasi dan Digital (Komdigi) Republik Indonesia dan Universitas… See the full description on the dataset page: https://huggingface.co/datasets/aitf-komdigi/EOS-Continued-Pretraining-Dataset.

sourceHugging Faceapache-2.0updated 9mo agoView on Hugging Face
1likes24downloads
6 commits on main
320c2879mo ago

Upload README.md with huggingface_hub

aitfindonesia
894662f9mo ago

Upload README.md with huggingface_hub

aitfindonesia
d63287a9mo ago

Upload dataset

aitfindonesia
34d8f119mo ago

Upload README.md with huggingface_hub

aitfindonesia
ccea8779mo ago

Upload dataset

aitfindonesia
c4dd2cc9mo ago

initial commit

aitfindonesia