isabeth/rgad-crosslingual-tts-10h
RGAD Cross-Lingual TTS 10h This is a 10-hour cross-lingual TTS dataset for prompt-conditioned Chinese TTS fine-tuning. Format The dataset contains: train.jsonl dev.jsonl metadata.csv audio/prompts/*.wav audio/targets/*.wav Each JSONL row has this format: {"id":"sample_000001","prompt_wav":"audio/prompts/sample_000001.wav","target_wav":"audio/targets/sample_000001.wav","text":"中文目标文本。","prompt_language":"en-US","target_language":"zh-CN"… See the full description on the dataset page: https://huggingface.co/datasets/isabeth/rgad-crosslingual-tts-10h.
180
RGAD Cross-Lingual TTS 10h
This is a 10-hour cross-lingual TTS dataset for prompt-conditioned Chinese TTS fine-tuning.
Format
The dataset contains:
train.jsonldev.jsonlmetadata.csvaudio/prompts/*.wavaudio/targets/*.wav
Each JSONL row has this format:
{"id":"sample_000001","prompt_wav":"audio/prompts/sample_000001.wav","target_wav":"audio/targets/sample_000001.wav","text":"中文目标文本。","prompt_language":"en-US","target_language":"zh-CN","speaker_id":"speaker_001"}Summary:
- rows: 6094
- target audio: 10:00:01
- prompt audio: 10:16:02
- train target audio: 09:47:54
- dev target audio: 00:12:07
Use With rgad-crosslingual-tts
huggingface-cli download isabeth/rgad-crosslingual-tts-10h \
--repo-type dataset \
--local-dir data/rgad-crosslingual-tts-10h
python scripts/prepare_prefix_manifest.py \
--input-jsonl data/rgad-crosslingual-tts-10h/train.jsonl \
--output-dir data/rgad-crosslingual-tts-10h/prefix_manifest \
--split train \
--prompt-text-policy duration_filler \
--prompt-crop-seconds 6
python scripts/prepare_prefix_manifest.py \
--input-jsonl data/rgad-crosslingual-tts-10h/dev.jsonl \
--output-dir data/rgad-crosslingual-tts-10h/prefix_manifest \
--split dev \
--prompt-text-policy duration_filler \
--prompt-crop-seconds 6