datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Estonian-Text-Simplification
Estonian Text Simplification
This repository contains resources and models for Estonian text simplification, including datasets and pre-trained models.
Files
Dataset Files
simplification_training_set.json: A dataset used to fine-tune LLaMA 3.1 for text simplification.
src: The source of the data.
original: The original sentence to be simplified.
simpl_lex: A lexical simplification (may be empty).
simpl_final: The final simplified sentence.… See the full description on the dataset page: https://huggingface.co/datasets/vulturuldemare/Estonian-Text-Simplification.wikilarge-text-simplificationage-specific-text-simplification
Age-Specific Text Simplification Dataset
Dataset Description
This dataset contains complex texts simplified into age-appropriate versions for children aged 3, 4, and 5 years old. Each original text has been professionally adapted to match the cognitive development, vocabulary, and comprehension abilities of each specific age group.
Dataset Summary
Total Examples: 17,177
Training Split: 15,459 examples
Validation Split: 1,718 examples
Languages:… See the full description on the dataset page: https://huggingface.co/datasets/hasankursun/age-specific-text-simplification.samer-arabic-text-simplification
SAMER Arabic Text Simplification Dataset (Cleaned Version)
Description
This dataset is a cleaned and structured version of the SAMER Corpus (The SAMER Arabic Text Simplification Corpus). It is prepared specifically for training Seq2Seq models (e.g., AraT5) and fine-tuning Large Language Models (LLMs) on Arabic Text Simplification and Readability Assessment tasks.
Dataset Structure
The dataset contains the following fields:
clean_text: Cleaned… See the full description on the dataset page: https://huggingface.co/datasets/vn3er/samer-arabic-text-simplification.wikilarge-text-simplificationnews-not-not-ela-text-simplificationTextSimplification-PTBR-330kenglish-text-simplification-for-finetuningbiendata_text_simplificationadaption-legal-text-simplification
This dataset is a remastered version prepared using Adaption's Adaptive Data platform.
adaption-legal_text_simplification
This dataset contains pairs of formal legal or institutional text prompts and their corresponding simplified, plain-language completions. The content focuses on translating complex terms regarding consumer responsibilities, examination policies, and liability into clear, everyday English. It is designed for training models to perform legal text… See the full description on the dataset page: https://huggingface.co/datasets/Karthikrv/adaption-legal-text-simplification.hindi-text-simplification-for-finetuningawadhi-text-simplification-for-finetuning
