CoolFace
Datasetpublic

risaleinur/risale-i-nur-sohbet

Risale-i Nur Sohbet Prof. Dr. Şener Dilek’ten izin alındı. Türkçe Risale-i Nur sohbetlerini ses, ham ASR metni ve zaman hizalı segmentler hâlinde birlikte sunan bağımsız bir veri kümesidir. İlk sürüm izinli ve doğrulanmış sohbetleri içerir; kitap metni, grounded, çok dilli veya kitap seslendirme veri kümelerine karıştırılmaz. Kapsam 2095 sohbet, 954.66 saat 16 kHz mono FLAC ses Aynı derslerin ölçülmüş 48 kHz kalite katmanı; 786 derste seçici… See the full description on the dataset page: https://huggingface.co/datasets/risaleinur/risale-i-nur-sohbet.

sourceHugging Faceupdated 16d agoView on Hugging Face
1likes1.2kdownloads
Dataset Card

Risale-i Nur Sohbet

Prof. Dr. Şener Dilek’ten izin alındı.

Türkçe

Risale-i Nur sohbetlerini ses, ham ASR metni ve zaman hizalı segmentler hâlinde birlikte sunan bağımsız bir veri kümesidir. İlk sürüm izinli ve doğrulanmış sohbetleri içerir; kitap metni, grounded, çok dilli veya kitap seslendirme veri kümelerine karıştırılmaz.

Kapsam

  • 2095 sohbet, 954.66 saat 16 kHz mono FLAC ses
  • Aynı derslerin ölçülmüş 48 kHz kalite katmanı; 786 derste seçici konuşma iyileştirmesi, diğerlerinde kaynak-sadık dönüşüm
  • 1036858 zaman hizalı segment ve 4762763 kelime zaman damgası
  • Ders/duplicate grubu düzeyinde sabit train, validation, test ayrımı
  • Dış ses bağlantısı yok; gerekli ses dosyaları veri kümesinin içindedir

Görünümler

Configİçerik
audio-textDers düzeyinde oynatılabilir ses ve tam transcript
audioDers düzeyinde doğrudan çözülebilen HF Audio alanı ve kısa metadata
quality-audio-textÖlçülmüş 48 kHz ses ve denetlenmiş transcript görünümü
quality-audioMetinsiz 48 kHz kalite ses katmanı
segmentsZaman hizalı segment metni ve başlangıç/bitiş zamanı
clipsHer segmentin oynatılabilir ses kesiti ve eş metni
textDers düzeyinde birleştirilmiş ham transcript
catalogDers, konuşmacı, seri ve konu kataloğu
word-timestampsKelime düzeyinde zaman ve güven değeri
referencesKaynak metadata ile desteklenen konu/seri/eser bağları

Transcriptler asr_verbatim olarak işaretlenmiştir; el ile düzeltilmiş metin gibi sunulmaz. Düşük güvenli 240 ders quality_status alanıyla açıkça işaretlenir. Arapça ve Kur'anî ibareler tahminle düzeltilmemiştir. quality-audio-text, sessizlikte bağımsız olarak doğrulanan açık ASR artefaktlarını ayrı ve izlenebilir bir katmanda çıkarır; belirsiz kalan 212 ders işaretli kalır.

Kullanım için varsayılan config audio-texttir:

python
from datasets import load_dataset

audio_text = load_dataset("risaleinur/risale-i-nur-sohbet", "audio-text")
quality_audio_text = load_dataset("risaleinur/risale-i-nur-sohbet", "quality-audio-text")
segments = load_dataset("risaleinur/risale-i-nur-sohbet", "segments")
clips = load_dataset("risaleinur/risale-i-nur-sohbet", "clips")
audio = load_dataset("risaleinur/risale-i-nur-sohbet", "audio")
catalog = load_dataset("risaleinur/risale-i-nur-sohbet", "catalog")

Görünümler lesson_id ile eşleşir. Konuşmacı, eser, seri ve konu bilgileri segmentlerde yinelenmez; catalog görünümünden alınır.

English

An independent collection of Risale-i Nur conversations with self-contained audio, raw ASR transcripts, and time-aligned segments. The first release contains authorized, verified talks and remains separate from the book-text, grounded, multilingual, and book-narration datasets.

Coverage

  • 2095 talks and 954.66 hours of 16 kHz mono FLAC audio
  • A measured 48 kHz quality layer for the same talks; selective speech enhancement on 786 lessons and source-preserving conversion on the remainder
  • 1036858 aligned segments and 4762763 word timestamps
  • Stable lesson/duplicate-group-level train, validation, and test splits
  • No external audio dependency; all required audio files are included

Transcripts are labeled asr_verbatim, not presented as manually corrected text. Lessons needing review remain usable and are marked through quality_status. Arabic and Qur'anic expressions were not changed by guesswork. The default audio-text view places playable lesson audio beside its complete transcript. Time-aligned rows remain available in segments; all views join through lesson_id. The quality-audio-text view keeps improvements separate and leaves 212 uncertain talks marked for review. The clips view embeds the exact playable audio slice beside every aligned segment. Speaker, work, series, and topic metadata remain in catalog instead of being repeated on every segment.

Version: v0.5.0 · Prepared: 2026-09-06