CoolFace
Datasetpublic

Exqrch/Rebuttal-lampung-pixelgpt

Lampung PixelGPT Tokenizer Ablation Dataset Optimized with Font Size 6 and Dynamic Trimming. Tokenizer Schema tok_grapheme: Language-specific Grapheme BPE (izzako/sunda-llama-tokenizer) tok_llama2: Standard Llama-2 BPE (ernie-research/DualGPT) tok_komodo: SEA-Optimized BPE (yellow-ai-central/komodo-7b-v1) tok_mt5: Google Multilingual Unigram (google/mt5-small)

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes8downloads
Dataset Card

Lampung PixelGPT Tokenizer Ablation Dataset

Optimized with Font Size 6 and Dynamic Trimming.

Tokenizer Schema

  1. 1.tok_grapheme: Language-specific Grapheme BPE (izzako/sunda-llama-tokenizer)
  2. 2.tok_llama2: Standard Llama-2 BPE (ernie-research/DualGPT)
  3. 3.tok_komodo: SEA-Optimized BPE (yellow-ai-central/komodo-7b-v1)
  4. 4.tok_mt5: Google Multilingual Unigram (google/mt5-small)