CoolFace
Datasetpublic

quocs/hatrang-voice-4h

VieNeu-TTS Vietnamese Speech Dataset Dataset Description Vietnamese text-to-speech dataset for fine-tuning VieNeu-TTS models. Contains paired audio recordings and Vietnamese text transcriptions. Dataset Structure Data Fields audio: Audio recording (WAV, 24kHz, mono, 16-bit PCM) transcription: Vietnamese text transcription of the audio Data Splits Split Samples train 1,805 Dataset Statistics… See the full description on the dataset page: https://huggingface.co/datasets/quocs/hatrang-voice-4h.

sourceHugging Faceupdated 8mo agoView on Hugging Face
2likes75downloads
Dataset Card

VieNeu-TTS Vietnamese Speech Dataset

Dataset Description

Vietnamese text-to-speech dataset for fine-tuning VieNeu-TTS models. Contains paired audio recordings and Vietnamese text transcriptions.

Dataset Structure

Data Fields

  • audio: Audio recording (WAV, 24kHz, mono, 16-bit PCM)
  • transcription: Vietnamese text transcription of the audio

Data Splits

SplitSamples
train1,805

Dataset Statistics

  • Total audio files: 1,805 (filtered from 2,406 raw recordings)
  • Audio format: WAV, 24kHz sample rate, mono, 16-bit PCM
  • Duration range: 3-15 seconds per sample
  • Total size: ~733 MB (audio)

Metadata Files

The following CSV files are included for fine-tuning convenience (pipe-delimited, no headers):

FileSamplesFormat
metadata.csv2,402`filename\text`
metadata_cleaned.csv1,805`filename\text`
metadata_encoded.csv1,805`filename\text\vq_codes`

Data Collection

Dataset was generated using asr-dataset-generation.

Audio-text pairs were collected and filtered with the following criteria:

  • Audio duration between 3.0 and 15.0 seconds
  • Valid Vietnamese text transcriptions
  • 597 samples removed during filtering (24.8% rejection rate)

Related Models

Usage

python
from datasets import load_dataset

dataset = load_dataset("quocs/hatrang-voice-4h")