quocs/hatrang-voice-4h
VieNeu-TTS Vietnamese Speech Dataset Dataset Description Vietnamese text-to-speech dataset for fine-tuning VieNeu-TTS models. Contains paired audio recordings and Vietnamese text transcriptions. Dataset Structure Data Fields audio: Audio recording (WAV, 24kHz, mono, 16-bit PCM) transcription: Vietnamese text transcription of the audio Data Splits Split Samples train 1,805 Dataset Statistics… See the full description on the dataset page: https://huggingface.co/datasets/quocs/hatrang-voice-4h.
VieNeu-TTS Vietnamese Speech Dataset
Dataset Description
Vietnamese text-to-speech dataset for fine-tuning VieNeu-TTS models. Contains paired audio recordings and Vietnamese text transcriptions.
Dataset Structure
Data Fields
- audio: Audio recording (WAV, 24kHz, mono, 16-bit PCM)
- transcription: Vietnamese text transcription of the audio
Data Splits
Dataset Statistics
- Total audio files: 1,805 (filtered from 2,406 raw recordings)
- Audio format: WAV, 24kHz sample rate, mono, 16-bit PCM
- Duration range: 3-15 seconds per sample
- Total size: ~733 MB (audio)
Metadata Files
The following CSV files are included for fine-tuning convenience (pipe-delimited, no headers):
Data Collection
Dataset was generated using asr-dataset-generation.
Audio-text pairs were collected and filtered with the following criteria:
- Audio duration between 3.0 and 15.0 seconds
- Valid Vietnamese text transcriptions
- 597 samples removed during filtering (24.8% rejection rate)
Related Models
- quocs/vieneu-0.3b-lora-hatrang - LoRA fine-tuned on this dataset
Usage
from datasets import load_dataset
dataset = load_dataset("quocs/hatrang-voice-4h")