CoolFace
Datasetpublic

gsaltintas/turkihs

Dataset Card for Tokenization Robustness TokSuite Benchmark (Turkish Collection) Dataset Description This dataset is part of TokSuite, a comprehensive benchmark designed to measure how different tokenization strategies affect language model performance and robustness. This specific subset contains Turkish language multiple-choice text completion questions with various real-world perturbations that test tokenizer robustness. Curated by: R3… See the full description on the dataset page: https://huggingface.co/datasets/gsaltintas/turkihs.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes67downloads
4 commits on main
9f9588d8mo ago

Upload folder using huggingface_hub

gsaltintas
ec351b18mo ago

Upload folder using huggingface_hub

gsaltintas
fb6c8ff8mo ago

Upload folder using huggingface_hub

gsaltintas
cd55d3e8mo ago

initial commit

gsaltintas