CoolFace
Modelpublic

nahiar/xlm-roberta-indonesian-languages

sourceHugging Faceapache-2.0updated 10mo agoView on Hugging Face
1likes272downloads
Model Card

Indonesian Regional Languages Identifier

Fine-tuned XLM-RoBERTa model for identifying 11 Indonesian regional languages + English.

Supported Languages

  • โ€”๐Ÿ‡ฎ๐Ÿ‡ฉ Indonesian (Bahasa Indonesia)
  • โ€”Acehnese (Bahasa Aceh)
  • โ€”Balinese (Basa Bali)
  • โ€”Banjarese (Bahasa Banjar)
  • โ€”Buginese (Basa Ugi)
  • โ€”Javanese (Basa Jawa)
  • โ€”Madurese (Basa Madhura)
  • โ€”Minangkabau (Baso Minang)
  • โ€”Ngaju (Basa Ngaju)
  • โ€”Sundanese (Basa Sunda)
  • โ€”Toba Batak (Hata Batak Toba)
  • โ€”๐Ÿ‡ฌ๐Ÿ‡ง English

Model Performance

  • โ€”Accuracy: 0.9783
  • โ€”F1 Macro: 0.9783
  • โ€”F1 Weighted: 0.9783
  • โ€”Precision: 0.9785
  • โ€”Recall: 0.9783

Usage

python
from transformers import pipeline

# Load model
classifier = pipeline("text-classification", model="YOUR_USERNAME/xlm-roberta-indonesian-languages")

# Single prediction
result = classifier("Sugeng enjing, piye kabare?")
print(result)
# Output: [{'label': 'javanese', 'score': 0.9876}]

# Batch prediction
texts = [
    "Selamat pagi, apa kabar?",
    "Wilujeng enjing, kumaha damang?",
    "Good morning, how are you?"
]

results = classifier(texts)
for text, result in zip(texts, results):
    print(f"{text} -> {result['label']} ({result['score']:.4f})")

Training Details

  • โ€”Base Model: xlm-roberta-base
  • โ€”Training Samples: 6000
  • โ€”Validation Samples: 1200
  • โ€”Epochs: 5
  • โ€”Learning Rate: 2e-05
  • โ€”Batch Size: 16
  • โ€”Training Date: 20251124_070409

Citation

If you use this model, please cite:

@misc{indonesian-language-id,
    author = {Raihan Hidayatullah Djunaedi},
    title = {Indonesian Regional Languages Identifier},
    year = {2025},
    publisher = {Hugging Face},
    url = {https://huggingface.co/nahiar/xlm-roberta-indonesian-languages}
}