aitf-komdigi/EOS-Continued-Pretraining-Dataset
EOS Continued Pre-Training Dataset (Indonesia) Deskripsi Dataset EOS Continued Pre-Training Dataset adalah korpus teks bahasa Indonesia berskala besar (~214.2 Juta Token) yang dikurasi secara khusus untuk proses Continued Pre-Training (CPT) pada Large Language Models (LLM). Dataset ini disusun sebagai bagian dari program Artificial Intelligence Talent Factory (AITF), kolaborasi antara Kementerian Komunikasi dan Digital (Komdigi) Republik Indonesia dan Universitas… See the full description on the dataset page: https://huggingface.co/datasets/aitf-komdigi/EOS-Continued-Pretraining-Dataset.
EOS Continued Pre-Training Dataset (Indonesia)
Deskripsi Dataset
EOS Continued Pre-Training Dataset adalah korpus teks bahasa Indonesia berskala besar (~214.2 Juta Token) yang dikurasi secara khusus untuk proses Continued Pre-Training (CPT) pada Large Language Models (LLM).
Dataset ini disusun sebagai bagian dari program Artificial Intelligence Talent Factory (AITF), kolaborasi antara Kementerian Komunikasi dan Digital (Komdigi) Republik Indonesia dan Universitas Brawijaya[cite: 713]. Tujuan utamanya adalah melakukan domain adaptation agar model fondasi (seperti Qwen/Llama) memahami konteks lokal, regulasi, dan terminologi spesifik Indonesia pada dua domain strategis:
- Pengawasan Ruang Digital (PRD)
- Digital Talent Pool (DTP)
Komposisi Data
Total volume dataset adalah 214.2 Juta Token yang terbagi menjadi tiga subset utama[cite: 65, 786]:
Metodologi Pengumpulan Data (Crawling)
Pengumpulan data dilakukan menggunakan teknik Web Crawling tingkat lanjut untuk menangani situs web modern yang dinamis[cite: 495].
Infrastruktur Crawling: Playwright
Berbeda dengan metode scraping konvensional, dataset ini dibangun menggunakan framework Playwright dengan Python[cite: 512]. Pendekatan ini dipilih karena:
- Handling Dynamic Content (CSR): Banyak portal berita menggunakan Client-Side Rendering yang memuat konten secara asinkron. Playwright memungkinkan eksekusi JavaScript penuh (headless browser) untuk menangkap konten yang tidak ada di HTML statis[cite: 497, 513].
- Asynchronous I/O: Dibangun di atas
asynciountuk melakukan request secara paralel (concurrency) dengan efisiensi tinggi[cite: 507]. - Anti-Bot Detection: Menggunakan teknik stealth seperti rotasi User-Agent dan penghapusan properti
navigator.webdriveruntuk menghindari blokir[cite: 570, 571].
Struktur dan Format Data
Dataset ini disajikan dalam format Raw Text (.txt) untuk memudahkan proses streaming saat pelatihan.
- Format File:
.txt - Separator Dokumen: Token
<im_end> - Struktur: Seluruh artikel digabungkan menjadi satu file teks panjang. Akhir dari setiap artikel/dokumen ditandai dengan token
<im_end>.
Contoh Format (Raw Text)
Kementerian Komunikasi dan Digital terus menggalakkan pemberantasan judi online... [Konten Artikel 1] ...bertujuan melindungi masyarakat.
<im_end>
