CoolFace
12 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01vulturuldemare /Estonian-Text-Simplification Estonian Text Simplification This repository contains resources and models for Estonian text simplification, including datasets and pre-trained models. Files Dataset Files simplification_training_set.json: A dataset used to fine-tune LLaMA 3.1 for text simplification. src: The source of the data. original: The original sentence to be simplified. simpl_lex: A lexical simplification (may be empty). simpl_final: The final simplified sentence.… See the full description on the dataset page: https://huggingface.co/datasets/vulturuldemare/Estonian-Text-Simplification.text10K<n<100K0 likes107 downloads2y agoHugging Face02bogdancazan /wikilarge-text-simplificationtext100K<n<1M5 likes89 downloads3y agoHugging Face03hasankursun /age-specific-text-simplification Age-Specific Text Simplification Dataset Dataset Description This dataset contains complex texts simplified into age-appropriate versions for children aged 3, 4, and 5 years old. Each original text has been professionally adapted to match the cognitive development, vocabulary, and comprehension abilities of each specific age group. Dataset Summary Total Examples: 17,177 Training Split: 15,459 examples Validation Split: 1,718 examples Languages:… See the full description on the dataset page: https://huggingface.co/datasets/hasankursun/age-specific-text-simplification.tabulartext-generation10K<n<100K3 likes79 downloads1y agoHugging Face04vn3er /samer-arabic-text-simplification SAMER Arabic Text Simplification Dataset (Cleaned Version) Description This dataset is a cleaned and structured version of the SAMER Corpus (The SAMER Arabic Text Simplification Corpus). It is prepared specifically for training Seq2Seq models (e.g., AraT5) and fine-tuning Large Language Models (LLMs) on Arabic Text Simplification and Readability Assessment tasks. Dataset Structure The dataset contains the following fields: clean_text: Cleaned… See the full description on the dataset page: https://huggingface.co/datasets/vn3er/samer-arabic-text-simplification.tabular10K<n<100K0 likes57 downloads11d agoHugging Face05Nechba /wikilarge-text-simplificationtext100K<n<1M0 likes37 downloads5mo agoHugging Face06bogdancazan /news-not-not-ela-text-simplificationtext100K<n<1M3 likes27 downloads3y agoHugging Face07cnmoro /TextSimplification-PTBR-330ktext100K<n<1M2 likes18 downloads3y agoHugging Face08raja20221020 /english-text-simplification-for-finetuningtext10K<n<100K0 likes11 downloads1y agoHugging Face09bogdancazan /biendata_text_simplificationtext10K<n<100K0 likes9 downloads3y agoHugging Face10Karthikrv /adaption-legal-text-simplification This dataset is a remastered version prepared using Adaption's Adaptive Data platform. adaption-legal_text_simplification This dataset contains pairs of formal legal or institutional text prompts and their corresponding simplified, plain-language completions. The content focuses on translating complex terms regarding consumer responsibilities, examination policies, and liability into clear, everyday English. It is designed for training models to perform legal text… See the full description on the dataset page: https://huggingface.co/datasets/Karthikrv/adaption-legal-text-simplification.text1K<n<10K0 likes9 downloads3mo agoHugging Face11raja20221020 /hindi-text-simplification-for-finetuningtext10K<n<100K0 likes4 downloads1y agoHugging Face12raja20221020 /awadhi-text-simplification-for-finetuningtext10K<n<100K0 likes3 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.