SPEAK-PP/sinhala-spelling-correction-already-corrected-pairs
Sinhala ASR Prediction-Reference Dataset (3000 no-numbers) Dataset Description This dataset contains sentence pairs for spelling correction: dyslexic_sentence: noisy / predicted text clean_sentence: clean reference text Dataset Statistics Split Samples Train 2,400 Eval 300 Test 300 Total 3,000 Usage from datasets import load_dataset dataset =… See the full description on the dataset page: https://huggingface.co/datasets/SPEAK-PP/sinhala-spelling-correction-already-corrected-pairs.
010
Sinhala ASR Prediction-Reference Dataset (3000 no-numbers)
Dataset Description
This dataset contains sentence pairs for spelling correction:
dyslexic_sentence: noisy / predicted textclean_sentence: clean reference text
Dataset Statistics
Usage
from datasets import load_dataset
dataset = load_dataset("SPEAK-PP/sinhala-spelling-correction-already-corrected-pairs")
print(dataset["train"][0])