occiglot/tokenizer-wiki-bench
Multilingual Tokenizer Benchmark This dataset includes pre-processed wikipedia data for tokenizer evaluation in 45 languages. We provide more information on the evaluation task in general this blogpost. Usage The dataset allows us to easily calculate tokenizer fertility and the proportion of continued words on any of the supported languages. In the example below we take the Mistral tokenizer and evaluate its performance on Slovak. from transformers import… See the full description on the dataset page: https://huggingface.co/datasets/occiglot/tokenizer-wiki-bench.
Upload dataset
Upload dataset
Upload dataset
Update README.md
Update README.md
Update README.md
Update README.md
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset (part 00002-of-00003)
Upload dataset (part 00001-of-00003)
Upload dataset (part 00000-of-00003)
Upload dataset
Upload dataset
Upload dataset
Update README.md
Update README.md
