CoolFace
Datasetpublic

jorgeortizfuentes/universal_spanish_chilean_corpus

Universal Chilean Spanish Corpus Este dataset se compone de 37_213_992 textos correspondientes a español de Chile y a español multidialectal. Los textos en español multidialectal provienen del spanish books. Los textos en español de Chile vienen de los dominios .cl del mc4 dataset y de tweets, noticias y reclamos de l chilean-spanish-corpus Name Count Source books 87967 spanish books mc4 8706681 from mc4 (.cl domains) in chilean-spanish-corpus twitter 27306583… See the full description on the dataset page: https://huggingface.co/datasets/jorgeortizfuentes/universal_spanish_chilean_corpus.

sourceHugging Faceunknownupdated 3y agoView on Hugging Face
8likes1.5kdownloads
Dataset Card

Universal Chilean Spanish Corpus

Este dataset se compone de 37213992 textos correspondientes a español de Chile y a español multidialectal.

Los textos en español multidialectal provienen del spanish books.

Los textos en español de Chile vienen de los dominios .cl del mc4 dataset y de tweets, noticias y reclamos de l chilean-spanish-corpus

NameCountSource
books87967spanish books
mc48706681from mc4 (.cl domains) in chilean-spanish-corpus
twitter27306583chilean-spanish-corpus
news1081542chilean-spanish-corpus
complaints31219chilean-spanish-corpus

Los textos del dataset han sido obtenidos mediante técnicas de web crawling sin distinguir sus derechos de autor. Por lo tanto, pueden tener derechos de autor restrictivos.