CoolFace
Datasetpublic

NMikka/Common-Voice-Geo-Cleaned

Common Voice Georgian — Cleaned for TTS/STT A high-quality subset of Mozilla Common Voice Georgian cleaned and filtered specifically for text-to-speech fine-tuning. Dataset Summary Total samples 21,421 Total duration 35.0 hours Speakers 12 Sample rate 24 kHz mono WAV Language Georgian (kat) Source Mozilla Common Voice 19.0 License CC-0 (public domain) Splits Split Samples Description train 20,300 Training… See the full description on the dataset page: https://huggingface.co/datasets/NMikka/Common-Voice-Geo-Cleaned.

sourceHugging Facecc0-1.0updated 7mo agoView on Hugging Face
9likes164downloads
../
fileeval-00000-of-00001.parquet243.4 MBdownload
filetest-00000-of-00001.parquet26.2 MBdownload
filetrain-00000-of-00013.parquet403.5 MBdownload
filetrain-00001-of-00013.parquet411.5 MBdownload
filetrain-00002-of-00013.parquet399.6 MBdownload
filetrain-00003-of-00013.parquet381.0 MBdownload
filetrain-00004-of-00013.parquet323.3 MBdownload
filetrain-00005-of-00013.parquet375.6 MBdownload
filetrain-00006-of-00013.parquet388.8 MBdownload
filetrain-00007-of-00013.parquet397.6 MBdownload
filetrain-00008-of-00013.parquet391.6 MBdownload
filetrain-00009-of-00013.parquet376.6 MBdownload
filetrain-00010-of-00013.parquet359.2 MBdownload
filetrain-00011-of-00013.parquet360.5 MBdownload
filetrain-00012-of-00013.parquet361.7 MBdownload

NMikka/Common-Voice-Geo-Cleaned · main · files are served by the source, never re-hosted here