CoolFace
Datasetpublic

Hritshhh/T5-dataset

T5 Grammar Correction Dataset This dataset combines Clang8 and Mohammed Ashraf's grammar correction datasets, tokenized for T5 model fine-tuning. Usage example from datasets import load_dataset dataset = load_dataset("Hritshhh/T5-Dataset")

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes18downloads
Dataset Card

T5 Grammar Correction Dataset

This dataset combines Clang8 and Mohammed Ashraf's grammar correction datasets, tokenized for T5 model fine-tuning.

Dataset description

  • —Input features: tokenized inputids and attentionmask
  • —Labels: tokenized target sequences
  • —Contains 2,982,134 training examples
  • —Total size: ~1.11GB

Usage example

python
from datasets import load_dataset
dataset = load_dataset("Hritshhh/T5-Dataset")