datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
aksara-mega-sft
Aksara Mega SFT — 64K+ Dataset Grade S
AksaraLLM Community mempersembahkan 64797 pasangan instruksi Indonesia kualitas tinggi.
Highlight Dataset
Pemahaman 10 Bahasa Daerah (Jawa, Sunda, Minang, dll) via NusaX
Ribuan QA Suku, Agama, dan Budaya Nusantara
SQuAD ID & Dolly 15K Indonesian
Orca Math Word Problems Indonesian
Guanaco & xP3x High Quality Conversations
38 Provinsi Lengkap & Etika Lokal
aksara-pretrain-id
AksaraLLM Pre-train v4
Total: 839,366 texts
Wikipedia + CulturaX + NusaX (11 bahasa daerah) + Wiki topik Indonesia
from datasets import load_dataset
ds = load_dataset("AksaraLLM/aksara-pretrain-id", split="train")
aksara-sft-clean-v6
AksaraLLM SFT Clean v6
High-quality Indonesian SFT dataset distilled from Gemini 2.5 Flash Lite
via Google Vertex AI, with strict quality gates.
Stats
Train: 16,752 items
Validation: 1,098 items
Total: 17,850 items
Teacher model: gemini-2.5-flash-lite
Task distribution
Task type
Count
factual_qa
4,023
creative
4,003
cultural
3,927
reasoning
3,258
how_to
2,639
Method
Curated ~100 Indonesian topic seeds across history… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v6.aksara-bahasa-daerah-v1
AksaraLLM Bahasa Daerah v1
Korpus pretraining untuk 8 bahasa daerah Indonesia, dihimpun dari Wikipedia snapshot Nov 2023.
Bahasa
ISO code
Rows (articles)
Notes
Bahasa Jawa
jv
73,380
Substantial
Bahasa Sunda
su
61,555
Substantial
Bahasa Minangkabau
min
227,143
Largest; ⚠️ contains many bot-generated stub articles
Bahasa Aceh
ace
13,003
Moderate
Bahasa Bugis
bug
15,880
Moderate
Bahasa Bali
ban
20,986
Moderate
Bahasa Banjar
bjn
10,519
Small
Bahasa Madura
mad
1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-bahasa-daerah-v1.aksara-sft-clean-v1
AksaraLLM SFT Clean v1
Versi clean dari AksaraLLM/aksara-sft-id, dengan distill_v4 identity pack yang sudah dededup.
Changes dari aksara-sft-id v5
Fix
Before
After
Factual error rows (e.g. "Bangkok is SEA largest city")
present
removed
Truncated / ellipsis-cut outputs
present
filtered
Exact pair duplicates
7
0
Identity pack from distill_v4
542 rows, 64% dup
211 deduped unique items
What's INCLUDED
Source
Rows (train)
Task type… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v1.aksara-dpo-idaksara-pretrain-clean-v1
AksaraLLM Pretrain Clean v1
Versi clean dari AksaraLLM/aksara-pretrain-id, ditambah Wikipedia-id (Nov 2023 fresh dump).
Changes dari aksara-pretrain-id v4
Fix
Before
After
Exact duplicate rows
48,009 (5.84%)
0
Train/val leakage
11.76%
0% (hash-based split)
NusaX [Bahasa X] prefix
5,388 rows contaminated
0 (stripped)
Malay rows labeled as Indonesian
~25%
≤ 5% (GlotLID P≥0.60 filter)
Gopher-style quality filter
No
Yes
URL blocklist (judi/spam)
No
Yes… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-pretrain-clean-v1.aksara-dpo-id-v3aksara-mega-sft-v2aksara-mega-sft-v3aksara-mega-sft-v5aksara-sft-id
AksaraLLM SFT v5 — Ensiklopedia Indonesia
35,721 instruction pairs
Konten Eksklusif
38 provinsi (ibukota, suku, bahasa, makanan, budaya, agama)
6 agama resmi + kepercayaan lokal
10 kerajaan Nusantara
10 pahlawan nasional
10 fauna/flora endemik
7 kamus bahasa daerah
7 rumah adat
20K synthetic QA
NusaX 11 bahasa
IndoQA, TyDi QA, Aya
from datasets import load_dataset
ds = load_dataset("AksaraLLM/aksara-sft-id", split="train")
aksara-pretrain-clean-v1.1
AksaraLLM Pretrain Clean v1.1
v1.1 adds a MinHash near-dedup pass on top of
aksara-pretrain-clean-v1.
Changes vs v1
Split
v1
v1.1
delta
Train
808,886
712,578
-96,308
Val
54,229
46,774
-7,455
Total
863,115
759,352
-103,763
Near-duplicates removed: 103,763.
Method
MinHash with num_perm=64
5-gram word shingles
LSH threshold = 0.85 Jaccard
Same hash-based train/val split as v1 (zero leakage, deterministic)
All other processing inherits from v1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-pretrain-clean-v1.1.aksara-v3-multiturn-cotaksara-dpo-id-v2aksara-mega-sft-v4aksara-dpo-pairs-v1aksara-dpo-id-v4aksara-dpo-clean-v1aksara-extra-sft
