rishchen/ukrainian-tts-audiobook-pani-nina-parquet
Ukrainian TTS audiobook dataset Pani Nina (Parquet) Segmented Ukrainian audiobook speech with aligned text, prepared for training and evaluating Text-to-Speech (TTS) models. The dataset is published as Hugging Face-compatible Parquet shards so the Hub Dataset Preview can render an audio column. The dataset was prepared using whisper and ffmpeg: Whisper was used for transcription and approximate segment timing. FFmpeg was used to slice audio into short utterances (roughly 2-10… See the full description on the dataset page: https://huggingface.co/datasets/rishchen/ukrainian-tts-audiobook-pani-nina-parquet.
017
train_base-00000.parquetdownload
train_base-00001.parquetdownload
train_base-00002.parquetdownload
train_base-00003.parquetdownload
train_base-00004.parquetdownload
train_base-00005.parquetdownload
train_base-00006.parquetdownload
train_base-00007.parquetdownload
train_base-00008.parquetdownload
train_base-00009.parquetdownload
train_base-00010.parquetdownload
train_base-00011.parquetdownload
train_base-00012.parquetdownload
train_base-00013.parquetdownload
