CoolFace
Datasetpublic

Mikhailo/ubertext-itn-uk

Ukrainian ITN Dataset ~889k sentence pairs for Ukrainian Inverse Text Normalization (ITN). Spoken-form → Written-form pairs generated from skypro1111/ubertext-2-news-verbalized using LLM-assisted annotation. Columns spoken: verbalized Ukrainian text (input for ITN) written: normalized text with digits, symbols, abbreviations Example spoken written сорок два відсотки населення 42% населення пʼятнадцять доларів і двадцять центів $15.20… See the full description on the dataset page: https://huggingface.co/datasets/Mikhailo/ubertext-itn-uk.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
0likes7downloads
Dataset Card

Ukrainian ITN Dataset

~889k sentence pairs for Ukrainian Inverse Text Normalization (ITN).

Spoken-form → Written-form pairs generated from skypro1111/ubertext-2-news-verbalized using LLM-assisted annotation.

Columns

  • —spoken: verbalized Ukrainian text (input for ITN)
  • —written: normalized text with digits, symbols, abbreviations

Example

spokenwritten
сорок два відсотки населення42% населення
пʼятнадцять доларів і двадцять центів$15.20
двадцять третього лютого дві тисячі двадцять четвертого року23 лютого 2024
температура мінус сімнадцять градусівтемпература -17 градусів

Usage

python
from datasets import load_dataset

ds = load_dataset("Mikhailo/ubertext-itn-uk")
print(ds["train"][0])