plain-text
flan_t5_large-imdb_reviews_plain_textESM_swedish_reviews_plain_texticdar23-entrydetector_plaintext_breaks_indents_left_difficdar23-entrydetector_plaintext_breaks_indents_left_reficdar23-entrydetector_plaintexticdar23-entrydetector_plaintext_breaks_indents_left_ref_right_refiva_mt_wslot-m2m100_418M-en-pl-plaintextESM_ajgt_twitter_ar_plain_text
vnexpress_plain_textvtv_plain_textTauri-RL-Plaintext-System-V2borges_plain_text_dataset
Dataset: Borges en texto plano
El objetivo de este repositorio es construir un dataset del gran autor argentino que pueda usarse para el entrenamiento de modelos de lenguaje.
Inicialmente partí de libros en formato EPUB y únicamente en español
Carpetas
Inicialmente planteo tres carpetas
Epub
Libros en este formato
Epub_a_txt
Libros convertidos con el sencillo script disponible en
https://github.com/lucasbiagettia/epub2txt
txt_limpios
A… See the full description on the dataset page: https://huggingface.co/datasets/lucasbiagettia/borges_plain_text_dataset.vnexpress_plain_text_suc_khoevnexpress_plain_text_thoi_su
