hoheyto/turkce_kod_aciklama_dataset
Türkçe Mizahi Kod Açıklama Veri Seti ~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor. Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar. Özellikler Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.
Türkçe Mizahi Kod Açıklama Veri Seti
~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor.
Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar.
Özellikler
- Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar ediyor. Yanlış değil, ama çeşitlilik açısından olumsuz etkiliyor.Ayrıca "sanki", "gibi" gibi benzetme kalıplarının gereksiz tekrarı, veri üretiminde kullanılan modellerin stil kalıplarının veri setine yansımasıyla ilişkili.
- Niş/ileri algoritmalarda yüzeysellik: Eğitim verisinde az temsil edilen konularda (örn. Heavy-Light Decomposition), açıklamalar teknik olarak yanlış değil ama daha genel/sığ kalıyor.
- Mizah bağlantısının tutarsızlığı: Bazı örneklerde mizah kodun mantığına güçlü şekilde bağlıyken (
moveZeroes,missingNumber), bazılarında daha zayıf/zorlama kalıyor. - CPU üzerinde çalışıyor: Demo, GGUF (Q4KM) formatında,
llama.cppile CPU'da servis ediliyor — GPU'ya göre belirgin şekilde yavaş (yanıt süresi ~2-3 dakika).
