CoolFace
Datasetpublic

Aamod37/Tokenizer-Testset

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes196downloads
../
fileAssamese_Latin-00000-of-00001.parquet161 KBdownload
fileBengali_Latin-00000-of-00001.parquet240 KBdownload
fileGujarati_Latin-00000-of-00001.parquet248 KBdownload
fileHindi_Latin-00000-of-00001.parquet209 KBdownload
fileKannada_Latin-00000-of-00001.parquet203 KBdownload
fileMalayalam_Latin-00000-of-00001.parquet11 KBdownload
fileMarathi_Latin-00000-of-00001.parquet223 KBdownload
fileMizo_Latin-00000-of-00001.parquet70 KBdownload
fileNepali_Latin-00000-of-00001.parquet247 KBdownload
fileOriya_Latin-00000-of-00001.parquet181 KBdownload
filePunjabi_Latin-00000-of-00001.parquet280 KBdownload
fileSanskrit_Latin-00000-of-00001.parquet125 KBdownload
fileSanskrit_Transliterated-00000-of-00001.parquet146 KBdownload
fileTamil_Latin-00000-of-00001.parquet226 KBdownload
fileTelugu_Latin-00000-of-00001.parquet920 KBdownload

Aamod37/Tokenizer-Testset · main · files are served by the source, never re-hosted here