CoolFace
Datasetpublic

SEACrowd/lti_langid_corpus

The LTI LangID corpus is a dataset for language identification. The most recent version, v5, contains training data for 1266 languages, and some (possibly very tiny) amount of text for a total of 1706 languages. This dataloader can only be executed in a BASH environment at the moment. (See https://github.com/SEACrowd/seacrowd-datahub/pull/405)

sourceHugging Faceunknownupdated 2y agoView on Hugging Face
0likes45downloads
7 commits on main
0f750ff2y ago

Upload README.md with huggingface_hub

holylovenia
f87e2f32y ago

Upload __init__.py with huggingface_hub

holylovenia
fb9efe02y ago

Upload lti_langid_corpus.py with huggingface_hub

holylovenia
51305d72y ago

Upload README.md with huggingface_hub

holylovenia
4b260142y ago

Upload LICENSE with huggingface_hub

holylovenia
29fcdc22y ago

Upload requirements.txt with huggingface_hub

holylovenia
fd76e512y ago

initial commit

holylovenia