CoolFace
Datasetpublic

Taklaxbr/khanacademy-turkish

Not: Bu veri setinin dokümantasyonu Türk yapay zeka topluluğuna katkı sağlamak amacıyla VeriPazarı tarafından Türkçeye çevrilmiştir. Orijinal veri seti ysdede tarafından geliştirilmiş olup, VeriPazarı tarafından Türk AI ekosistemi için arşivlenmiştir. 🔗 Orijinal Kaynak: ysdede/khanacademy-turkish 🔗 Derleyen Platform: VeriPazarı Khan Academy Türkçe Ses Veri Seti Bu veri seti, Khan Academy Türkçe YouTube kanalından elde edilmiş 78 saatlik ses kaydını içermektedir. Veriler, her… See the full description on the dataset page: https://huggingface.co/datasets/Taklaxbr/khanacademy-turkish.

sourceHugging Facecc-by-sa-3.0updated 4mo agoView on Hugging Face
0likes98downloads
Dataset Card
Not: Bu veri setinin dokümantasyonu Türk yapay zeka topluluğuna katkı sağlamak amacıyla VeriPazarı tarafından Türkçeye çevrilmiştir. Orijinal veri seti ysdede tarafından geliştirilmiş olup, VeriPazarı tarafından Türk AI ekosistemi için arşivlenmiştir. 🔗 Orijinal Kaynak: ysdede/khanacademy-turkish 🔗 Derleyen Platform: VeriPazarı

Khan Academy Türkçe Ses Veri Seti

Bu veri seti, Khan Academy Türkçe YouTube kanalından elde edilmiş 78 saatlik ses kaydını içermektedir. Veriler, her biri ortalama 10.5 saniye uzunluğunda olan kısa kliplere (segmentlere) bölünmüştür.

Bu veri setinin yanında, kaynak materyalin genel bir görünümünü sunan detaylı bir video dosya ağacı (file tree) bulacaksınız.

Veri Seti Oluşturma Süreci: Sesler, Khan Academy Türkçe YouTube kanalından çekilmiş ve yüksek kalite ile hassas bölümlendirme (segmentation) sağlamak için çeşitli teknikler kullanılarak işlenmiştir. Özel olarak, sesi kısa kliplere doğru bir şekilde bölmek için yüksek kaliteli yeniden örnekleme (resampling), ses aktivite tespiti (Voice Activity Detection - VAD) ve zorunlu hizalama (forced alignment) uygulanmıştır.

Ayrıca, sese eşlik eden transkriptler üzerinde metin işleme (text processing) gerçekleştirilmiş ve yerelleştirme (localization) düzeltmeleri yapılmıştır. Örneğin, sayı formatları Türkçe kurallarına uygun olarak binlik ayracı “.” ve ondalık ayracı “,” olacak şekilde ayarlanmış ve çeşitli ince iyileştirmeler eklenmiştir.

Ses Özellikleri (Audio Specifications)

  • —Format: MP3
  • —Kanallar (Channels): Mono
  • —Örnekleme Hızı (Sampling Rate): 16.000 Hz
  • —Ortalama Süre: Her klip için 10.5 saniye

Bu veri setini konuşma işleme (speech processing), ses analizi ve ilgili makine öğrenimi görevlerindeki araştırma ve geliştirme çalışmaları için kullanabilirsiniz.

Lisans

Khan Academy içerikleri Creative Commons Attribution-NonCommercial-ShareAlike 3.0 Unported Lisansı altında sunulmaktadır. Lütfen Khan Academy'nin lisanslama politikasında belirtilen şekilde uygun atıfı (attribution) yaptığınızdan emin olun.

Not: Tüm Khan Academy içeriklerine ücretsiz olarak (www.khanacademy.org) adresinden ulaşabilirsiniz.

Bu dosya veripazari.com.tr topluluğu tarafından Hugging Face altyapısında barındırılmaktadır. Orijinal emeğe saygı kuralımız gereği lisans ve model isimleri korunmuştur.