humanify/Env-TTS-SD-Corpus
env-tts-sd-corpus Environment-aware text-to-speech training corpus. Each row pairs three short 16 kHz mono FLAC clips with a transcript: an environment sample (different speaker, same acoustic scene), a speaker reference (same speaker, optionally with augmented acoustics), the target speech, so a TTS model can learn to synthesise a target utterance with both a specified voice and a specified environment. Schema column type description… See the full description on the dataset page: https://huggingface.co/datasets/humanify/Env-TTS-SD-Corpus.
Formal English README
status update
status update
status update
status update
status update
status update
status update
status update
status update
status update
status update
status update
Add group_00098
status update
status update
Add group_00097
status update
status update
status update
Add group_00096
status update
Add group_00095
status update
status update
status update
Add group_00094
status update
Add group_00093
status update
status update
Add group_00092
status update
Add group_00091
status update
status update
Add group_00090
status update
Add group_00089
status update
status update
Add group_00088
status update
status update
status update
status update
status update
status update
status update
status update
