CoolFace
Datasetpublic

aimeri/ticuna-spanish-portuguese

Ticuna (tca) – Spanish – Portuguese Corpus First text corpus for Ticuna (ISO 639-3 tca), a tonal language isolate of the Brazil/Colombia/Peru tri-border. Configs | Config | Rows | | parallel | train 43,248 / validation 596 / test 3,238 | | monolingual | train 46,545 / validation 298 / test 1,613 | | lexicon | train 10,419 / validation 568 / test 539 | | instructions | train 52,836 | | backtranslation | train 33,944 | The short version of what matters… See the full description on the dataset page: https://huggingface.co/datasets/aimeri/ticuna-spanish-portuguese.

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes99downloads
10 commits on main
5f6fd511mo ago

Update README.md

aimeri
6c5e02a1mo ago

Update README.md

aimeri
13a556a1mo ago

Delete code

aimeri
03173f61mo ago

Delete provenance

aimeri
f54c2231mo ago

Delete provenance/license-audit.md

aimeri
a20b9aa1mo ago

dataset v0.1: full local build (private, training-only)

aimeri
14956b41mo ago

dataset v0.1: full local build (private, training-only)

aimeri
0abaa7a1mo ago

dataset v0.1: full local build (private, training-only)

aimeri
687205f1mo ago

dataset v0.1: full local build (private, training-only)

aimeri
14d507a1mo ago

initial commit

aimeri