CoolFace
Datasetpublic

hoheyto/turkce_kod_aciklama_dataset

Türkçe Mizahi Kod Açıklama Veri Seti ~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor. Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar. Özellikler Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.

sourceHugging Facemitupdated 24d agoView on Hugging Face
0likes66downloads
Dataset Card

Türkçe Mizahi Kod Açıklama Veri Seti

~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor.

Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar.

Özellikler

  • —Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar ediyor. Yanlış değil, ama çeşitlilik açısından olumsuz etkiliyor.Ayrıca "sanki", "gibi" gibi benzetme kalıplarının gereksiz tekrarı, veri üretiminde kullanılan modellerin stil kalıplarının veri setine yansımasıyla ilişkili.
  • —Niş/ileri algoritmalarda yüzeysellik: Eğitim verisinde az temsil edilen konularda (örn. Heavy-Light Decomposition), açıklamalar teknik olarak yanlış değil ama daha genel/sığ kalıyor.
  • —Mizah bağlantısının tutarsızlığı: Bazı örneklerde mizah kodun mantığına güçlü şekilde bağlıyken (moveZeroes, missingNumber), bazılarında daha zayıf/zorlama kalıyor.
  • —CPU üzerinde çalışıyor: Demo, GGUF (Q4KM) formatında, llama.cpp ile CPU'da servis ediliyor — GPU'ya göre belirgin şekilde yavaş (yanıt süresi ~2-3 dakika).

Eğitildiği Model:

hoheyto/JokerCoder