CoolFace
6 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01AksaraLLM /aksara-mega-sft Aksara Mega SFT — 64K+ Dataset Grade S AksaraLLM Community mempersembahkan 64797 pasangan instruksi Indonesia kualitas tinggi. Highlight Dataset Pemahaman 10 Bahasa Daerah (Jawa, Sunda, Minang, dll) via NusaX Ribuan QA Suku, Agama, dan Budaya Nusantara SQuAD ID & Dolly 15K Indonesian Orca Math Word Problems Indonesian Guanaco & xP3x High Quality Conversations 38 Provinsi Lengkap & Etika Lokal texttext-generation10K<n<100K0 likes63 downloads6mo agoHugging Face02AksaraLLM /aksara-sft-clean-v6 AksaraLLM SFT Clean v6 High-quality Indonesian SFT dataset distilled from Gemini 2.5 Flash Lite via Google Vertex AI, with strict quality gates. Stats Train: 16,752 items Validation: 1,098 items Total: 17,850 items Teacher model: gemini-2.5-flash-lite Task distribution Task type Count factual_qa 4,023 creative 4,003 cultural 3,927 reasoning 3,258 how_to 2,639 Method Curated ~100 Indonesian topic seeds across history… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v6.texttext-generation10K<n<100K0 likes29 downloads5mo agoHugging Face03AksaraLLM /aksara-bahasa-daerah-v1 AksaraLLM Bahasa Daerah v1 Korpus pretraining untuk 8 bahasa daerah Indonesia, dihimpun dari Wikipedia snapshot Nov 2023. Bahasa ISO code Rows (articles) Notes Bahasa Jawa jv 73,380 Substantial Bahasa Sunda su 61,555 Substantial Bahasa Minangkabau min 227,143 Largest; ⚠️ contains many bot-generated stub articles Bahasa Aceh ace 13,003 Moderate Bahasa Bugis bug 15,880 Moderate Bahasa Bali ban 20,986 Moderate Bahasa Banjar bjn 10,519 Small Bahasa Madura mad 1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-bahasa-daerah-v1.texttext-generation100K<n<1M0 likes26 downloads5mo agoHugging Face04AksaraLLM /aksara-sft-clean-v1 AksaraLLM SFT Clean v1 Versi clean dari AksaraLLM/aksara-sft-id, dengan distill_v4 identity pack yang sudah dededup. Changes dari aksara-sft-id v5 Fix Before After Factual error rows (e.g. "Bangkok is SEA largest city") present removed Truncated / ellipsis-cut outputs present filtered Exact pair duplicates 7 0 Identity pack from distill_v4 542 rows, 64% dup 211 deduped unique items What's INCLUDED Source Rows (train) Task type… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v1.texttext-generation10K<n<100K0 likes23 downloads5mo agoHugging Face05AksaraLLM /aksara-pretrain-clean-v1 AksaraLLM Pretrain Clean v1 Versi clean dari AksaraLLM/aksara-pretrain-id, ditambah Wikipedia-id (Nov 2023 fresh dump). Changes dari aksara-pretrain-id v4 Fix Before After Exact duplicate rows 48,009 (5.84%) 0 Train/val leakage 11.76% 0% (hash-based split) NusaX [Bahasa X] prefix 5,388 rows contaminated 0 (stripped) Malay rows labeled as Indonesian ~25% ≤ 5% (GlotLID P≥0.60 filter) Gopher-style quality filter No Yes URL blocklist (judi/spam) No Yes… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-pretrain-clean-v1.texttext-generation100K<n<1M0 likes17 downloads5mo agoHugging Face06AksaraLLM /aksara-pretrain-clean-v1.1 AksaraLLM Pretrain Clean v1.1 v1.1 adds a MinHash near-dedup pass on top of aksara-pretrain-clean-v1. Changes vs v1 Split v1 v1.1 delta Train 808,886 712,578 -96,308 Val 54,229 46,774 -7,455 Total 863,115 759,352 -103,763 Near-duplicates removed: 103,763. Method MinHash with num_perm=64 5-gram word shingles LSH threshold = 0.85 Jaccard Same hash-based train/val split as v1 (zero leakage, deterministic) All other processing inherits from v1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-pretrain-clean-v1.1.texttext-generation100K<n<1M0 likes13 downloads5mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.