Hritshhh/T5-dataset
T5 Grammar Correction Dataset This dataset combines Clang8 and Mohammed Ashraf's grammar correction datasets, tokenized for T5 model fine-tuning. Usage example from datasets import load_dataset dataset = load_dataset("Hritshhh/T5-Dataset")
018
T5 Grammar Correction Dataset
This dataset combines Clang8 and Mohammed Ashraf's grammar correction datasets, tokenized for T5 model fine-tuning.
Dataset description
- Input features: tokenized inputids and attentionmask
- Labels: tokenized target sequences
- Contains 2,982,134 training examples
- Total size: ~1.11GB
Usage example
from datasets import load_dataset
dataset = load_dataset("Hritshhh/T5-Dataset")