datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
quran-terjemahan-indonesia-audio-by-ayah
Audio Terjemahan Al-Qur'an Indonesia per Ayat
Dataset ini berisi audio terjemahan Al-Qur'an bahasa Indonesia yang dipisahkan per ayat.
Audio dibuat menggunakan Gemini TTS dari teks terjemahan Al-Qur'an bahasa Indonesia. Setiap file audio mewakili satu ayat.
Isi Dataset
6.236 file audio WAV
6.236 file audio M4A/AAC terkompresi untuk aplikasi mobile
Bahasa Indonesia
Satu file audio untuk setiap ayat
Format WAV dan M4A/AAC
Disusun berdasarkan nomor surah dan nomor… See the full description on the dataset page: https://huggingface.co/datasets/insanalamin/quran-terjemahan-indonesia-audio-by-ayah.indonesian-voice-transcription-1.4.9a-rindonesian-voice-transcription-1.4.9a.2indonesian-voice-transcription-1.4.85aindonesian-voice-transcription-1.4.9a-cv-fl-slrjv-mdindonesian-voice-transcription-1.3.9cindonesian-voice-transcription-1.4.9rcvindonesian-voice-transcription-1.4.9aindonesian-voice-transcription-1.5.9a-cv-fl-slrjv-mdDataset-Text-To-Speech-Indonesia
🎵 Dataset Audio Bahasa Indonesia
Dataset audio berkualitas tinggi untuk Text-to-Speech (TTS) bahasa Indonesia.
Dibuat oleh : Muhammad Arief, S.Kom.Universitas Muhammadiyah SorongTeknik Informatika 2020
📊 Spesifikasi Teknis
Parameter
Nilai
Satuan
Total Durasi
16.38
jam
Jumlah Segmen
4531
file
Durasi Rata-rata
13.01
detik
Sample Rate KHz
22
kHz
Sample Rate Hz
22000
Hz
Bit Depth
PCM_16
PCM
Format
wav
Lossless
🔄 Urutan Pengolahan… See the full description on the dataset page: https://huggingface.co/datasets/X-lord/Dataset-Text-To-Speech-Indonesia.indonesian-voice-transcription-1.4.9rindonesian-voice-transcription-1.0Noorwise-quran-indonesian-max
Noorwise Quran Indonesian Max
Complete Quran (114 Surahs) with Indonesian (Bahasa) translation audio. Each surah contains Arabic recitation followed by Indonesian translation.
Dataset Summary
Total Surahs: 114 (complete Quran)
Language: Arabic (recitation) + Indonesian (translation)
Audio Format: MP3
Total Duration: ~43 hours
Total Size: ~2.0 GB
License: MIT
Data Structure
Each entry in Idmax.json contains the following fields:
Field
Type… See the full description on the dataset page: https://huggingface.co/datasets/Shaahadath/Noorwise-quran-indonesian-max.indonesian-voice-transcription-1.1.85quran-indonesian-translation-audio-by-ayah
Audio Terjemahan Al-Qur'an Indonesia per Ayat
Dataset ini berisi audio terjemahan Al-Qur'an bahasa Indonesia yang dipisahkan per ayat.
Audio dibuat menggunakan Gemini TTS dari teks terjemahan Al-Qur'an bahasa Indonesia. Setiap file audio mewakili satu ayat.
Isi Dataset
6.236 file audio
Bahasa Indonesia
Satu file audio untuk setiap ayat
Format WAV
Disusun berdasarkan nomor surah dan nomor ayat
Struktur File
audio/
001/
001001.wav… See the full description on the dataset page: https://huggingface.co/datasets/insanalamin/quran-indonesian-translation-audio-by-ayah.indonesian-voice-transcription-1.4.9a-cv-flindonesian-voice-transcription-1.2.9indonesian-voice-transcription-1.1.85synthetic-data-indonesia_testsynthetic-data-indonesiaindonesian-speech-datasetsynthetic-data-indonesia_2_4synthetic-data-indonesia_2_4_updatedindonesian-voice-transcription-1.2.9cIndonesian-Speech-Dataset
🎧 Indonesian Speech Dataset
The Indonesian Speech Dataset is a high-quality speech audio dataset designed to deliver structured and scalable audio data for AI-powered voice systems. It contains 162 hours of audio data across 821 files, provided in MP3 and WAV formats, with a total size of 210 MB. This well-curated audio dataset ensures balanced and representative voice data, with 51% female and 49% male speakers, and a broad age distribution from 18 to 50+ years. The dataset… See the full description on the dataset page: https://huggingface.co/datasets/Speech-data/Indonesian-Speech-Dataset.synthetic-data-indonesia_2_4_testsynthetic-data-indonesia_2_4_overlapindonesian-audiobook-tts40hours_Indonesian_Colloquial_ASR_Speech_Dataset
BabelSpeech 50-Hour Indonesian Colloquial ASR Speech Dataset
Contains 50 hours of Indonesian colloquial ASR speech data, aligned with natural, everyday Indonesian communication patterns.
Metadata is stored in a separate JSON file, including audio path, duration, transcript confidence, signal-to-noise ratio (SNR), and DNSMOS. More metadata fields may be added in future updates.
Covered domains: technology, entertainment, travel, education, daily life, and others.
Data quality: Each… See the full description on the dataset page: https://huggingface.co/datasets/BabelSpeech/40hours_Indonesian_Colloquial_ASR_Speech_Dataset.indonesian-speech-dataset
