CoolFace
Datasetpublic

izzako/balinese-pixelgpt

Balinese PixelGPT Dataset This dataset contains preprocessed Balinese text data for training PixelGPT models. Dataset Statistics Language: Balinese (bali) Total samples: 54,467 Train samples: 54,017 Test samples: 450 Tokenizers Grapheme tokenizer: izzako/javanese-llama-tokenizer LLaMA tokenizer: ernie-research/DualGPT Features text_id: Document identifier chunk_id: Chunk identifier within document pixel_values: Rendered pixel… See the full description on the dataset page: https://huggingface.co/datasets/izzako/balinese-pixelgpt.

sourceHugging Facecc-by-4.0updated 9mo agoView on Hugging Face
0likes62downloads
3 commits on main
8b7c5379mo ago

Add dataset description with YAML metadata

izzako
7e190889mo ago

Added both train and test splits - 54,467 total samples

izzako
084e8849mo ago

initial commit

izzako