CoolFace
Datasetpublic

Exqrch/Rebuttal-javanese-pixelgpt

Javanese PixelGPT Tokenizer Ablation Dataset Optimized with Font Size 6 and Dynamic Trimming. Tokenizer Schema tok_grapheme: Language-specific Grapheme BPE (izzako/javanese-llama-tokenizer) tok_llama2: Standard Llama-2 BPE (ernie-research/DualGPT) tok_komodo: SEA-Optimized BPE (yellow-ai-central/komodo-7b-v1) tok_mt5: Google Multilingual Unigram (google/mt5-small)

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes86downloads
4 commits on main
c5fef006mo ago

Upload README.md with huggingface_hub

Exqrch
aa5bd4e6mo ago

tokenizer ablation study setup (part 00001-of-00002)

Exqrch
9f386686mo ago

tokenizer ablation study setup (part 00000-of-00002)

Exqrch
bfb3a626mo ago

initial commit

Exqrch