aksarallm
aksara-mega-sft
Aksara Mega SFT — 64K+ Dataset Grade S
AksaraLLM Community mempersembahkan 64797 pasangan instruksi Indonesia kualitas tinggi.
Highlight Dataset
Pemahaman 10 Bahasa Daerah (Jawa, Sunda, Minang, dll) via NusaX
Ribuan QA Suku, Agama, dan Budaya Nusantara
SQuAD ID & Dolly 15K Indonesian
Orca Math Word Problems Indonesian
Guanaco & xP3x High Quality Conversations
38 Provinsi Lengkap & Etika Lokal
aksara-pretrain-id
AksaraLLM Pre-train v4
Total: 839,366 texts
Wikipedia + CulturaX + NusaX (11 bahasa daerah) + Wiki topik Indonesia
from datasets import load_dataset
ds = load_dataset("AksaraLLM/aksara-pretrain-id", split="train")
aksara-sft-clean-v6
AksaraLLM SFT Clean v6
High-quality Indonesian SFT dataset distilled from Gemini 2.5 Flash Lite
via Google Vertex AI, with strict quality gates.
Stats
Train: 16,752 items
Validation: 1,098 items
Total: 17,850 items
Teacher model: gemini-2.5-flash-lite
Task distribution
Task type
Count
factual_qa
4,023
creative
4,003
cultural
3,927
reasoning
3,258
how_to
2,639
Method
Curated ~100 Indonesian topic seeds across history… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v6.aksara-bahasa-daerah-v1
AksaraLLM Bahasa Daerah v1
Korpus pretraining untuk 8 bahasa daerah Indonesia, dihimpun dari Wikipedia snapshot Nov 2023.
Bahasa
ISO code
Rows (articles)
Notes
Bahasa Jawa
jv
73,380
Substantial
Bahasa Sunda
su
61,555
Substantial
Bahasa Minangkabau
min
227,143
Largest; ⚠️ contains many bot-generated stub articles
Bahasa Aceh
ace
13,003
Moderate
Bahasa Bugis
bug
15,880
Moderate
Bahasa Bali
ban
20,986
Moderate
Bahasa Banjar
bjn
10,519
Small
Bahasa Madura
mad
1… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-bahasa-daerah-v1.aksara-sft-clean-v1
AksaraLLM SFT Clean v1
Versi clean dari AksaraLLM/aksara-sft-id, dengan distill_v4 identity pack yang sudah dededup.
Changes dari aksara-sft-id v5
Fix
Before
After
Factual error rows (e.g. "Bangkok is SEA largest city")
present
removed
Truncated / ellipsis-cut outputs
present
filtered
Exact pair duplicates
7
0
Identity pack from distill_v4
542 rows, 64% dup
211 deduped unique items
What's INCLUDED
Source
Rows (train)
Task type… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-sft-clean-v1.aksara-unified-datasets-v1
AksaraLLM/aksara-unified-datasets-v1
Unified AksaraLLM datasets generated from TPU output.
Files
aksara_sft_base.jsonl
aksara_sft_synthetic.jsonl
aksara_sft_final.jsonl
aksara_sigap.jsonl
aksara_dpo.jsonl
aksara_pretrain_seed.jsonl
dataset_manifest.json
Counts
{
"sft_base": 44793,
"sft_synthetic": 583,
"sft_final": 45376,
"sigap": 135,
"dpo": 6000,
"pretrain_seed": 45390
}
Final Sources
{
"aksarallm_v3": 1649,
"sigap_clean_v2": 130… See the full description on the dataset page: https://huggingface.co/datasets/AksaraLLM/aksara-unified-datasets-v1.
