AksaraLLM/aksara-tokenizer-v1
0
AksaraLLM Tokenizer v1
Custom BPE tokenizer optimized for Indonesian and local languages.
Stats
- Vocab Size: 32,768
- Algorithm: Byte-Pair Encoding (BPE)
- Pre-tokenizer: ByteLevel
- Training Data: AksaraLLM pre-train + SFT corpus
Supported Languages
- Bahasa Indonesia (ID)
- Bahasa Jawa (JV)
- Bahasa Sunda (SU)
- Bahasa Bali (BAL)
- Bahasa Batak (BTK)
- Bahasa Bugis (BUG)
- Bahasa Minangkabau (MIN)
- Bahasa Madura (MAD)
- Bahasa Aceh (ACE)
- Bahasa Banjar (BJN)
- English (EN)
Special Tokens (29)
Usage
from tokenizers import Tokenizer
# Load
tok = Tokenizer.from_file("tokenizer.json")
# or from HuggingFace:
# from huggingface_hub import hf_hub_download
# path = hf_hub_download("AksaraLLM/aksara-tokenizer-v1", "tokenizer.json")
# tok = Tokenizer.from_file(path)
# Encode
encoded = tok.encode("Selamat pagi, apa kabar?")
print(encoded.ids)
print(encoded.tokens)
# Decode
decoded = tok.decode(encoded.ids)
print(decoded)Comparison vs GPT-2
Fewer tokens = faster inference + cheaper training + better quality.
License
Apache 2.0
