mustafabasar/model-egitme-sft-v1
Türkçe İK Belge Zekâsı — SFT verisi ve LoRA adapterleri Türkçe bir insan kaynakları bildirimini 29 alanlı bir JSON sözleşmesine çeviren küçük bir modelin eğitim verisi ve adapterleri. Canlı demo: https://huggingface.co/spaces/mustafabasar/ik-belge-asistani-demo Ne var burada yol ne veri_v3/ … veri_v9/ sürümlenmiş eğitim/doğrulama verisi (train.jsonl, dev.jsonl) v34/ … v45/ LoRA adapterleri (lora/) ve eğitim kayıtları sema/ Pydantic sözleşmesi… See the full description on the dataset page: https://huggingface.co/datasets/mustafabasar/model-egitme-sft-v1.
Türkçe İK Belge Zekâsı — SFT verisi ve LoRA adapterleri
Türkçe bir insan kaynakları bildirimini 29 alanlı bir JSON sözleşmesine çeviren küçük bir modelin eğitim verisi ve adapterleri.
Canlı demo: https://huggingface.co/spaces/mustafabasar/ik-belge-asistani-demo
Ne var burada
Teslim edilen sürüm: `v44/lora`. Taban model unsloth/gemma-4-E2B-it, LoRA r=8, alpha=8, ağırlık 50,7 MB.
Ölçülen kalite
%75,1 kodlu alan doğruluğu (1625/2164 karar, 32 vaka, sürüm v44).
Kodlu alan = kapalı bir listeden seçilen değer (risk türü, davranış niteliği, eylem durumu gibi). Serbest metin bu sayıya girmez; serbest metin için birebir eşleşme doğru bir ölçüt değildir.
Görev bazında:
Toplam sayı bu kararların tamamı üzerinden hesaplanır; bulgular ve kisiler ağırlıklıdır. celiskiler satırı ölçülmemiş sayılmalıdır (4 karar, eşik 16).
Bu sayı bağımsız değildir
Eğitim verisini ve ölçüm setini aynı üretici yazıyor. İnsan onaylı bir referans set tamamlanmadı. Sayı, hattın çalıştığını gösterir; modelin gerçek dünyada ne yapacağını göstermez.
Kesin olan tek şey biçimdir. Zorlanmış çözümleme (grammar), şemada olmayan bir alan adı ya da kapalı liste dışında bir değer üretilmesini imkânsız kılar. Bu bir ölçüm değil, bir kısıttır.
Görev sekiz parçaya bölünmüştür
Üç model tek seferde 29 alanlı belgeyi bitiremedi; tekrar döngüsüne girip bütçeyi tüketti. Bölününce doğrulama kaybı 1,04 → 0,21.
Sıra sabittir ve her adım öncekinin özetini bağlam olarak alır:
siniflandirma → iddialar → kisiler → bulgular
→ celiskiler → risk → ozel_degerlendirme → eylemlerUçtan uca ölçüldü (2026-08-15, canlı demo, işlemci): sekiz görev 29/29 alan üretti ve birleşik belge Pydantic sözleşmesinden geçti. Toplam 4,9 dakika.
Kullanım
import json, torch
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
REPO = "mustafabasar/model-egitme-sft-v1"
TABAN = "unsloth/gemma-4-E2B-it"
tok = AutoTokenizer.from_pretrained(TABAN)
model = AutoModelForCausalLM.from_pretrained(TABAN, dtype=torch.bfloat16)
model = PeftModel.from_pretrained(model, f"{REPO}/v44/lora")
model.eval()
# İstem, eğitimdekiyle BİREBİR aynı olmalıdır:
# <vaka metni>
#
# GOREV: <görev tanımı>
#
# BAGLAM:
# {önceki adımların küçük özeti}
#
# YALNIZ su alanlari uret: <alan listesi>Tam çalışan örnek için demo Space'in app.py dosyasına bakın.
Zorlanmış çözümleme önerilir. Grammar olmadan model şema dışı alan adı ve değer üretebilir; ölçüldü (v43):bilgi_kaynemi,bel_as_kisinin_biliyorklerigibi uydurma adlar.
Sürüm seçerken dikkat
Doğrulama kaybı, kaliteyi öngörmüyor. Ölçüldü:
v44 ile v45 kayıpta ayrık, kalitede eşit. Seçim, birleşik belgenin sözleşmeden geçmesine dayandı: v44 30/32, v45 26/32.
Eski sürümler ölçülemez. v37–v43 şemanın eski bir hâliyle eğitildi (alan adları ve liste değerleri sonradan değişti). Güncel şemayla ölçmek, onlara öğrenmedikleri bir sözleşmeyi sormak olur.
Sınırlar
- Örneklem 16 vaka — eşiğin tam sınırında.
- Sayı bağımsız değil (yukarı bakın).
celiskilergörevi ölçüm bölümünde temsil edilmiyor (9 karar).- Kapsam boşluğu açık: şemadaki 231 değerin 38'i veride hiç geçmiyor.
risk_olasiligialanında bir değer vakaların %72'sini kaplıyor; model çoğunluk sınıfını ezberliyor. Üretici tarafında onarıldı, yeni veri turunda etki edecek.
Bu liste kısaltılmadı. Bilinen her sınır burada.
