alibayram/magibu-11b-v8-mlx
alibayram/magibu-11b-v8-mlx
This model was converted to MLX format from [alibayram/magibu-11b-v8-mlx]() using mlx-vlm version 0.3.11. Refer to the original model card for more details on the model.
Use with mlx
pip install -U mlx-vlmpython -m mlx_vlm.generate --model alibayram/magibu-11b-v8-mlx --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image <path_to_image><div align="center">
<img src="https://huggingface.co/magibu/magibu-11b-v0.8/resolve/main/magibu-11B_logo.png" width="200" alt="Magibu AI Logo" />
🧿 Magibu-11b-v0.8
Türkçe İçin Geliştirilmiş, Çok Modlu (Multimodal) Model
Cetvel Türkçe Benchmark'ta 34 model arasında 3. sıra 🥉 · QA'da 1. sıra 🥇 · 27B+ modellerle rekabet eder · Multimodal (Görsel + Metin)
   
</div> ---
📋 Model Hakkında
Magibu-11b-v0.8, Magibu AI Research tarafından geliştirilen, Türkçe odaklı, çok dilli, Çok Modlu (Multimodal) bir modeldir.
Önemli Not: Bu model, mevcut bir modelin üzerine yapılan basit bir "fine-tune" işlemi değildir. Magibu-11b, kendi geliştirdiğimiz özgün eğitim yöntemleri ve veri setleri ile üretilmiştir. Google Gemma-3 modeli güncel kütüphanelerle (Transformers, VLLM, Ollama vb.) tam uyumlu çalışabilmesi için hem bilgi hem de altyapı standardı olarak kullanılmıştır.
Türkçe'ye özel optimize edilmiş tokenizer'ı sayesinde, dünyadaki en token-verimli Türkçe modellerden biridir.
Neden Magibu?
Standart tokenizer'lar Türkçe kelimeleri anlamsız, çok sayıda küçük parçaya böler. Bu durum şunlara yol açar:
- Yüksek Maliyet: Aynı cümle için daha fazla token üretilir.
- Yavaş Çalışma: Daha fazla token = daha yavaş yanıt üretimi.
- Ziyan Olan Kapasite: Context penceresi (hafıza) gereksiz yere dolar.
Magibu, Türkçe'ye özel eğitim süreci sayesinde bu sorunu çözer ve diğer tüm modellerden %30 - %127 daha verimli çalışır.
🏆 Türkçe MMLU Benchmark Sonuçları
Magibu-11b-v0.8, Türkçe MMLU benchmark testinde %74.40 başarı oranı ile 44 açık kaynak model arasında 6. sırada yer almaktadır. Kendisinden 2 ila 6 kat daha büyük modelleri geride bırakmayı başarmıştır.
🔑 Öne Çıkan Karşılaştırmalar
🔥 Magibu-11b (11B) vs. Llama-3.1 (70B): Magibu, 70 Milyar parametreli Llama-3.1 modelini +4 puan farkla geçmiştir (%74.40 vs %70.42). Bunu yaparken 6 kat daha az işlem gücü ve %54 daha az token kullanır.
🏛️ Magibu-11b vs. Turkish-Gemma-9b-T1 (YTU COSMOS): Yıldız Teknik Üniversitesi COSMOS Lab tarafından geliştirilen Turkish-Gemma-9b-T1 modeli %70.34 skor almıştır. Magibu, benzer parametre sayısında +4.06 puan fark atarak ve çok daha verimli çalışarak öne çıkmaktadır.
📊 Sıralama Tablosu (İlk 25)
Token Farkı: Magibu-11b'ye kıyasla diğer modellerin aynı metni ifade etmek için yüzde kaç daha fazla token kullandığını gösterir. Pozitif değerler, modelin Türkçe için daha az verimli olduğunu (daha çok token harcadığını) belirtir.
🎯 Cetvel Türkçe Benchmark Sonuçları
Magibu-11b-v0.8, Cetvel — Türkçe için en kapsamlı birleşik LLM benchmark'ında — 34 model arasında 3. sırada yer almaktadır (ortalama: 32.5).
7 farklı NLP kategorisinde (GEC, MCQA, MT, NLI, QA, SUM, TC) toplam 26 görevde değerlendirilen model, 14B altındaki en yüksek puanlı model olarak öne çıkmaktadır. Kendisinden 3-6 kat büyük modelleri (aya-23-35B, aya-expanse-32b vs.) geride bırakmayı başarmıştır.
🥇 Soru Cevaplama (QA) kategorisinde tüm modeller arasında 1. sıra — 45.0 puanla en yakın rakibini (Qwen2.5-14B, 26.7) büyük farkla geçmiştir. 🥈 Özetleme (SUM) kategorisinde 2. sıra — 24.9 puanla aya-expanse-32b'yi (22.4) geride bırakmıştır.
📊 Cetvel Sıralama Tablosu
Kategori Kısaltmaları: GEC = Gramer Düzeltme, MCQA = Çoktan Seçmeli, MT = Makine Çevirisi, NLI = Doğal Dil Çıkarımı, QA = Soru Cevaplama, SUM = Özetleme, TC = Metin Sınıflandırma
🔍 Kategori Detayları
🥇 Soru Cevaplama (QA) — 45.0 puan — Tüm Modeller Arasında 1. Sıra
🥈 Özetleme (SUM) — 24.9 puan — Tüm Modeller Arasında 2. Sıra
📝 Çoktan Seçmeli (MCQA) — 49.3 puan
🏷️ Metin Sınıflandırma (TC) — 44.9 puan
🔗 Doğal Dil Çıkarımı (NLI) — 32.1 puan
✏️ Gramer Düzeltme (GEC) — 19.6 puan
🌐 Makine Çevirisi (MT) — 11.4 puan
🧠 Ek: TurkishMMLU Sonuçları (Cetvel ile) — 56.6 ortalama
Cetvel değerlendirmesi kapsamında ayrıca çalıştırılan TurkishMMLU alt görevleri (standart sıralamaya dahil değildir):
🏗️ Ek: Türk Kültürü ve Dil Görevleri — 58.2 ortalama
💡 Güçlü ve Zayıf Yönler (Cetvel)
Güçlü Yönler:
- QA'da Sınıfının Lideri: 45.0 puanla tüm sıralamada 1. sıra. En yakın rakip (Qwen2.5-14B) 26.7 puan almıştır.
- Özetleme Gücü: 24.9 puanla 32B'lik aya-expanse modelini geride bırakmıştır.
- Boyut Verimliliği: 11B parametre ile 35B'ye kadar tüm modelleri geçmiştir (aya-23-35B: 31.7).
- Türk Kültürü Bilgisi: TurkishMMLU'da Felsefe %83, Din Kültürü %79, Coğrafya %71 ile güçlü Türk kültürel bilgi birikimi.
Geliştirmeye Açık Alanlar:
- Makine Çevirisi (11.4): Model paralel çeviri için özel olarak eğitilmemiştir.
- NLI (32.1): Sıralama ortalamasının biraz altında.
- GEC (19.6): Birebir eşleşme metriği, parafraz yapabilen chat modeli için sert bir ölçüttür.
📋 Değerlendirme Detayları
Not: Değerlendirme görev başına 500 örnek limiti ile yapılmıştır. Tam veri seti ile yapılan değerlendirmelerde ±%2-3 sapma beklenebilir. Detaylı rapor ve replikasyon rehberi için: cetvel_results_magibu_11b_v0.8.md
📊 Görsel Analizler
📈 MMLU Sıralaması
44 modelin Türkçe performans sıralaması. Magibu-11b (turuncu ◆), kendisinden çok daha büyük modelleri (Llama-3.1 70B, Gemma-2 27B vb.) geride bırakmıştır.

🎯 Token Verimliliği vs. Performans
Bu grafik, modellerin doğruluğu (Y ekseni) ile token harcamasını (X ekseni) karşılaştırır. İdeal konum sol üst köşedir (az token, çok başarı). Magibu-11b bu bölgede tek başınadır.

📊 Tokenizer Verimlilik Karşılaştırması
Modellerin aynı Türkçe veri setini (MMLU) kaç token ile ifade ettiğinin karşılaştırması. Magibu en düşük token sayısına sahiptir.

🏷️ Model Aileleri Karşılaştırması
Farklı model ailelerinin (Gemma, Llama, Qwen, vb.) verimlilik gruplandırması. Magibu (turuncu ●) diğer tüm ailelerden ayrı bir verimlilik sınıfındadır.

🧪 Token Verimliliği Nedir? Neden Önemli?
Türkçe'nin Yapısal Sorunu
Türkçe gibi sondan eklemeli dillerde kelimeler ek alarak uzar. Standart Batı dilleri için eğitilmiş tokenizer'lar bu kelimeleri verimsiz böler.
Örnek:
Sonuç: alibayram/turkish_mmlu veri setinin tamamı tokenize edildiğinde ortaya çıkan farklar:
Pratik Etkisi: Magibu ile 1000 token tutan bir işlem, diğer modellerde 1300-2200 token tutar. Magibu kullanmak daha hızlıdır, daha ucuzdur ve daha uzun metinleri hafızada tutabilir.
🚀 Hızlı Başlangıç (Quick Start)
🤗 Transformers
from transformers import pipeline
soru = "Zaman makineniz olsaydı ve sadece bir kez geçmişe ya da geleceğe gidebilseydiniz, hangisini seçerdiniz ve neden?"
generator = pipeline("text-generation", model="magibu/magibu-11b-v0.8", device="cuda")
cevap = generator(
[{"role": "user", "content": soru}],
max_new_tokens=512,
return_full_text=False
)[0]
print(cevap["generated_text"])🖼️ Görsel Kullanımı (Multimodal)
Magibu-11b, görselleri anlayabilir ve soruları yanıtlayabilir (VLM):
from transformers import AutoProcessor, AutoModelForImageTextToText
from PIL import Image
model = AutoModelForImageTextToText.from_pretrained("magibu/magibu-11b-v0.8", device_map="auto")
processor = AutoProcessor.from_pretrained("magibu/magibu-11b-v0.8")
image = Image.open("foto.jpg")
messages = [
{"role": "user", "content": [
{"type": "image", "image": image},
{"type": "text", "text": "Bu fotoğrafta ne görüyorsun? Detaylı açıkla."}
]}
]
inputs = processor.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=512)
print(processor.decode(output[0], skip_special_tokens=True))🦙 Ollama (Kolay Kurulum)
# Tek komutla kur ve çalıştır
ollama run alibayram/magibu-11b-v8🍎 MLX (Apple Silicon - M1/M2/M3/M4)
pip install mlx-vlm
# OpenAI uyumlu sunucu başlat
mlx_vlm.server --model alibayram/magibu-11b-v8-mlx --port 8080
# Veya Python içinde kullan
mlx_vlm.generate --model alibayram/magibu-11b-v8-mlx --prompt "Merhaba, nasılsın?"📦 İndirme Seçenekleri (Model Formats)
⚠️ Sınırlamalar ve Uyarılar
- Deneysel Sürüm (v0.8): Bu model halen aktif geliştirme aşamasındadır.
- Halüsinasyon: Tüm dil modelleri gibi, Magibu da zaman zaman yanlış bilgi üretebilir. Kritik konularda (sağlık, hukuk) doğruluğu teyit edilmelidir.
- Bilgi Kesimi: Eğitim verisinin kapsadığı tarih aralığı sınırlıdır, en güncel olayları bilmeyebilir.
- Yanlılık: Eğitim verisinden kaynaklı toplumsal önyargılar barındırabilir.
🔗 Kaynaklar
📜 Atıf (Citation)
Modeli çalışmalarınızda kullanırsanız lütfen aşağıdaki şekilde atıf yapınız:
@misc{bayram2025magibu,
title = {{Magibu-11b: A Turkish-Native Multilingual Vision-Language Model with Optimized Tokenization}},
author = {Ali Bayram},
year = 2025,
howpublished = {\url{https://huggingface.co/magibu/magibu-11b-v0.8}},
note = {Developed by Magibu AI Research}
}<div align="center">
[Magibu AI Research](https://magibu.web.app/) tarafından ❤️ ile geliştirildi 🧿
Geri bildirimleriniz bizim için değerlidir — [demo](https://magibu-chat.web.app/) üzerindeki butonu kullanarak iletebilirsiniz.
</div>
