CoolFace
20 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01AksaraLLM /aksara-mega-sft Aksara Mega SFT — 64K+ Dataset Grade S AksaraLLM Community mempersembahkan 64797 pasangan instruksi Indonesia kualitas tinggi. Highlight Dataset Pemahaman 10 Bahasa Daerah (Jawa, Sunda, Minang, dll) via NusaX Ribuan QA Suku, Agama, dan Budaya Nusantara SQuAD ID & Dolly 15K Indonesian Orca Math Word Problems Indonesian Guanaco & xP3x High Quality Conversations 38 Provinsi Lengkap & Etika Lokal texttext-generation10K<n<100K0 likes63 downloads6mo agoHugging Face02AksaraLLM /aksara-pretrain-id AksaraLLM Pre-train v4 Total: 839,366 texts Wikipedia + CulturaX + NusaX (11 bahasa daerah) + Wiki topik Indonesia from datasets import load_dataset ds = load_dataset("AksaraLLM/aksara-pretrain-id", split="train") text100K<n<1M0 likes41 downloads6mo agoHugging Face03AksaraLLM /aksara-sft-clean-v6 AksaraLLM SFT Clean v6 High-quality Indonesian SFT dataset distilled from Gemini 2.5 Flash Lite via Google Vertex AI, with strict quality gates. Stats Train: 16,752 items Validation: 1,098 items Total: 17,850 items Teacher model: gemini-2.5-flash-lite Task distribution Task type Count factual_qa 4,023 creative 4,003 cultural 3,927 reasoning 3,258 how_to 2,639 Method Curated ~100 Indonesian topic seeds across history… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v6.texttext-generation10K<n<100K0 likes29 downloads5mo agoHugging Face04AksaraLLM /aksara-bahasa-daerah-v1 AksaraLLM Bahasa Daerah v1 Korpus pretraining untuk 8 bahasa daerah Indonesia, dihimpun dari Wikipedia snapshot Nov 2023. Bahasa ISO code Rows (articles) Notes Bahasa Jawa jv 73,380 Substantial Bahasa Sunda su 61,555 Substantial Bahasa Minangkabau min 227,143 Largest; ⚠️ contains many bot-generated stub articles Bahasa Aceh ace 13,003 Moderate Bahasa Bugis bug 15,880 Moderate Bahasa Bali ban 20,986 Moderate Bahasa Banjar bjn 10,519 Small Bahasa Madura mad 1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-bahasa-daerah-v1.texttext-generation100K<n<1M0 likes26 downloads5mo agoHugging Face05AksaraLLM /aksara-sft-clean-v1 AksaraLLM SFT Clean v1 Versi clean dari AksaraLLM/aksara-sft-id, dengan distill_v4 identity pack yang sudah dededup. Changes dari aksara-sft-id v5 Fix Before After Factual error rows (e.g. "Bangkok is SEA largest city") present removed Truncated / ellipsis-cut outputs present filtered Exact pair duplicates 7 0 Identity pack from distill_v4 542 rows, 64% dup 211 deduped unique items What's INCLUDED Source Rows (train) Task type… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v1.texttext-generation10K<n<100K0 likes23 downloads5mo agoHugging Face06AksaraLLM /aksara-dpo-idtext10K<n<100K0 likes17 downloads5mo agoHugging Face07AksaraLLM /aksara-pretrain-clean-v1 AksaraLLM Pretrain Clean v1 Versi clean dari AksaraLLM/aksara-pretrain-id, ditambah Wikipedia-id (Nov 2023 fresh dump). Changes dari aksara-pretrain-id v4 Fix Before After Exact duplicate rows 48,009 (5.84%) 0 Train/val leakage 11.76% 0% (hash-based split) NusaX [Bahasa X] prefix 5,388 rows contaminated 0 (stripped) Malay rows labeled as Indonesian ~25% ≤ 5% (GlotLID P≥0.60 filter) Gopher-style quality filter No Yes URL blocklist (judi/spam) No Yes… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-pretrain-clean-v1.texttext-generation100K<n<1M0 likes17 downloads5mo agoHugging Face08AksaraLLM /aksara-dpo-id-v3text100K<n<1M0 likes16 downloads5mo agoHugging Face09AksaraLLM /aksara-mega-sft-v2text10K<n<100K0 likes14 downloads5mo agoHugging Face10AksaraLLM /aksara-mega-sft-v3text10K<n<100K0 likes14 downloads5mo agoHugging Face11AksaraLLM /aksara-mega-sft-v5text100K<n<1M0 likes14 downloads5mo agoHugging Face12AksaraLLM /aksara-sft-id AksaraLLM SFT v5 — Ensiklopedia Indonesia 35,721 instruction pairs Konten Eksklusif 38 provinsi (ibukota, suku, bahasa, makanan, budaya, agama) 6 agama resmi + kepercayaan lokal 10 kerajaan Nusantara 10 pahlawan nasional 10 fauna/flora endemik 7 kamus bahasa daerah 7 rumah adat 20K synthetic QA NusaX 11 bahasa IndoQA, TyDi QA, Aya from datasets import load_dataset ds = load_dataset("AksaraLLM/aksara-sft-id", split="train") text10K<n<100K0 likes13 downloads6mo agoHugging Face13AksaraLLM /aksara-pretrain-clean-v1.1 AksaraLLM Pretrain Clean v1.1 v1.1 adds a MinHash near-dedup pass on top of aksara-pretrain-clean-v1. Changes vs v1 Split v1 v1.1 delta Train 808,886 712,578 -96,308 Val 54,229 46,774 -7,455 Total 863,115 759,352 -103,763 Near-duplicates removed: 103,763. Method MinHash with num_perm=64 5-gram word shingles LSH threshold = 0.85 Jaccard Same hash-based train/val split as v1 (zero leakage, deterministic) All other processing inherits from v1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-pretrain-clean-v1.1.texttext-generation100K<n<1M0 likes13 downloads5mo agoHugging Face14AksaraLLM /aksara-v3-multiturn-cottext1K<n<10K0 likes11 downloads5mo agoHugging Face15AksaraLLM /aksara-dpo-id-v2text10K<n<100K0 likes9 downloads5mo agoHugging Face16AksaraLLM /aksara-mega-sft-v4text100K<n<1M0 likes9 downloads5mo agoHugging Face17AksaraLLM /aksara-dpo-pairs-v1textn<1K0 likes7 downloads5mo agoHugging Face18AksaraLLM /aksara-dpo-id-v4text100K<n<1M0 likes7 downloads5mo agoHugging Face19AksaraLLM /aksara-dpo-clean-v1text100K<n<1M0 likes7 downloads5mo agoHugging Face20AksaraLLM /aksara-extra-sfttextn<1K0 likes5 downloads5mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.