CoolFace
Datasetpublic

Exqrch/Rebuttal-lampung-pixelgpt

Lampung PixelGPT Tokenizer Ablation Dataset Optimized with Font Size 6 and Dynamic Trimming. Tokenizer Schema tok_grapheme: Language-specific Grapheme BPE (izzako/sunda-llama-tokenizer) tok_llama2: Standard Llama-2 BPE (ernie-research/DualGPT) tok_komodo: SEA-Optimized BPE (yellow-ai-central/komodo-7b-v1) tok_mt5: Google Multilingual Unigram (google/mt5-small)

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes8downloads
3 commits on main
efac4976mo ago

Upload README.md with huggingface_hub

Exqrch
3efda4e6mo ago

tokenizer ablation study setup

Exqrch
8f231456mo ago

initial commit

Exqrch