SynDataLab-JA-Refs/irodori-refs-10k
Irodori TTS Reference Voices (10K) 10,000 synthetic Japanese reference voices generated with the Irodori-TTS-500M-v2-VoiceDesign model from voice-design captions (no reference audio — no_ref=True). Each row is one unique speaker. Columns column type description audio Audio(48kHz mono) reference waveform text string Japanese utterance with emoji prosody cues speaker_id string speaker_00001 … speaker_10000 Related datasets Clones… See the full description on the dataset page: https://huggingface.co/datasets/SynDataLab-JA-Refs/irodori-refs-10k.
064
