softcatala/catalan-youtube-speech
Catalan YouTube Speech Corpus This dataset contains 231,684 short audio clips of spontaneous Catalan speech, automatically extracted from public YouTube videos. Each clip is paired with two independent machine-generated transcription candidates, along with speaker gender, clip timing, and the source video's reuse license. It was built and published by Softcatalà, the volunteer organization behind free/open-source Catalan-language software. Homepage: https://www.softcatala.org/… See the full description on the dataset page: https://huggingface.co/datasets/softcatala/catalan-youtube-speech.
3147
audio-0.tardownload
audio-1.tardownload
audio-10.tardownload
audio-11.tardownload
audio-12.tardownload
audio-13.tardownload
audio-14.tardownload
audio-15.tardownload
audio-16.tardownload
audio-17.tardownload
audio-18.tardownload
audio-19.tardownload
audio-2.tardownload
audio-20.tardownload
audio-21.tardownload
audio-22.tardownload
audio-23.tardownload
audio-24.tardownload
audio-25.tardownload
audio-26.tardownload
audio-27.tardownload
audio-28.tardownload
audio-29.tardownload
audio-3.tardownload
audio-30.tardownload
audio-31.tardownload
audio-32.tardownload
audio-33.tardownload
audio-34.tardownload
audio-35.tardownload
audio-36.tardownload
audio-37.tardownload
audio-38.tardownload
audio-39.tardownload
audio-4.tardownload
audio-40.tardownload
audio-41.tardownload
audio-42.tardownload
audio-43.tardownload
audio-44.tardownload
audio-45.tardownload
audio-46.tardownload
audio-47.tardownload
audio-48.tardownload
audio-49.tardownload
audio-5.tardownload
audio-50.tardownload
audio-6.tardownload
audio-7.tardownload
audio-8.tardownload
audio-9.tardownload
