risaleinur/risale-i-nur-sohbet
Risale-i Nur Sohbet Prof. Dr. Şener Dilek’ten izin alındı. Türkçe Risale-i Nur sohbetlerini ses, ham ASR metni ve zaman hizalı segmentler hâlinde birlikte sunan bağımsız bir veri kümesidir. İlk sürüm izinli ve doğrulanmış sohbetleri içerir; kitap metni, grounded, çok dilli veya kitap seslendirme veri kümelerine karıştırılmaz. Kapsam 2095 sohbet, 954.66 saat 16 kHz mono FLAC ses Aynı derslerin ölçülmüş 48 kHz kalite katmanı; 786 derste seçici… See the full description on the dataset page: https://huggingface.co/datasets/risaleinur/risale-i-nur-sohbet.
Risale-i Nur Sohbet
Prof. Dr. Şener Dilek’ten izin alındı.
Türkçe
Risale-i Nur sohbetlerini ses, ham ASR metni ve zaman hizalı segmentler hâlinde birlikte sunan bağımsız bir veri kümesidir. İlk sürüm izinli ve doğrulanmış sohbetleri içerir; kitap metni, grounded, çok dilli veya kitap seslendirme veri kümelerine karıştırılmaz.
Kapsam
- 2095 sohbet, 954.66 saat 16 kHz mono FLAC ses
- Aynı derslerin ölçülmüş 48 kHz kalite katmanı; 786 derste seçici konuşma iyileştirmesi, diğerlerinde kaynak-sadık dönüşüm
- 1036858 zaman hizalı segment ve 4762763 kelime zaman damgası
- Ders/duplicate grubu düzeyinde sabit
train,validation,testayrımı - Dış ses bağlantısı yok; gerekli ses dosyaları veri kümesinin içindedir
Görünümler
Transcriptler asr_verbatim olarak işaretlenmiştir; el ile düzeltilmiş metin gibi sunulmaz. Düşük güvenli 240 ders quality_status alanıyla açıkça işaretlenir. Arapça ve Kur'anî ibareler tahminle düzeltilmemiştir. quality-audio-text, sessizlikte bağımsız olarak doğrulanan açık ASR artefaktlarını ayrı ve izlenebilir bir katmanda çıkarır; belirsiz kalan 212 ders işaretli kalır.
Kullanım için varsayılan config audio-texttir:
from datasets import load_dataset
audio_text = load_dataset("risaleinur/risale-i-nur-sohbet", "audio-text")
quality_audio_text = load_dataset("risaleinur/risale-i-nur-sohbet", "quality-audio-text")
segments = load_dataset("risaleinur/risale-i-nur-sohbet", "segments")
clips = load_dataset("risaleinur/risale-i-nur-sohbet", "clips")
audio = load_dataset("risaleinur/risale-i-nur-sohbet", "audio")
catalog = load_dataset("risaleinur/risale-i-nur-sohbet", "catalog")Görünümler lesson_id ile eşleşir. Konuşmacı, eser, seri ve konu bilgileri segmentlerde yinelenmez; catalog görünümünden alınır.
English
An independent collection of Risale-i Nur conversations with self-contained audio, raw ASR transcripts, and time-aligned segments. The first release contains authorized, verified talks and remains separate from the book-text, grounded, multilingual, and book-narration datasets.
Coverage
- 2095 talks and 954.66 hours of 16 kHz mono FLAC audio
- A measured 48 kHz quality layer for the same talks; selective speech enhancement on 786 lessons and source-preserving conversion on the remainder
- 1036858 aligned segments and 4762763 word timestamps
- Stable lesson/duplicate-group-level train, validation, and test splits
- No external audio dependency; all required audio files are included
Transcripts are labeled asr_verbatim, not presented as manually corrected text. Lessons needing review remain usable and are marked through quality_status. Arabic and Qur'anic expressions were not changed by guesswork. The default audio-text view places playable lesson audio beside its complete transcript. Time-aligned rows remain available in segments; all views join through lesson_id. The quality-audio-text view keeps improvements separate and leaves 212 uncertain talks marked for review. The clips view embeds the exact playable audio slice beside every aligned segment. Speaker, work, series, and topic metadata remain in catalog instead of being repeated on every segment.
Version: v0.5.0 · Prepared: 2026-09-06
