keyvan-ai/Mankei-1B-Chat
<p align="center"><img src="mankei-logo.png" width="200" alt="Mankei"></p>
Mankei-1B-Chat (experimentell)
Deutsches Chat-Sprachmodell mit 1,01 Mrd. Parametern, von Grund auf in Deutschland trainiert — eigener deutscher Tokenizer (32k), auf einer einzelnen Karte. Gebaut für den CPU-Betrieb, und die Grundlage der Mankei-326M-Embedder- und Mankei-326M-Reranker-Modelle.
Fähigkeiten
- Deutsche Faktenabfragen (z. B. „Hauptstadt von Bayern" → „München")
- Rückfrage bzw. Zurückhaltung bei Unsicherheit statt erfundener Antworten
- Flüssiges, grammatisches Deutsch
Benchmark — deutsches MMLU (deutsche From-Scratch-Modelle)
Multiple-Choice per Log-Likelihood auf deutschem MMLU, verglichen mit anderen von Grund auf trainierten deutschen Modellen (faire Klasse):
Mankei-1B führt das deutsche From-Scratch-Feld an. Kleine From-Scratch-Modelle liegen bei reinem Faktenwissen generell nahe dem Zufallsniveau (25 %) — Mankeis Stärke sind deutscher Sprachfluss und souveräner lokaler Betrieb, nicht der Wissens-Benchmark.
Verwendung
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
tok = AutoTokenizer.from_pretrained("keyvan-ai/Mankei-1B-Chat")
model = AutoModelForCausalLM.from_pretrained("keyvan-ai/Mankei-1B-Chat", dtype=torch.bfloat16)
msgs = [{"role": "user", "content": "Was ist die Hauptstadt von Bayern?"}]
ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt")
out = model.generate(ids, max_new_tokens=64, temperature=0.7, top_p=0.9,
repetition_penalty=1.15, do_sample=True)
print(tok.decode(out[0][ids.shape[1]:], skip_special_tokens=True))Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.
Lokaler Betrieb (GGUF)
GGUF-Quantisierungen (f16 → Q3KM) direkt in diesem Repo — und gespiegelt im eigenen keyvan-ai/Mankei-1B-Chat-GGUF (Model-Tree):
# Ollama
ollama run hf.co/keyvan-ai/Mankei-1B-Chat:Q4_K_M
# llama.cpp
llama-cli -hf keyvan-ai/Mankei-1B-Chat:Q4_K_MEmpfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.
Architektur
Llama-Architektur · 1,013 Mrd. Parameter · hidden 1536 · 32 Layer · 24/6 Heads (GQA) · SwiGLU · RMSNorm · RoPE θ 500 000 · Kontext 4096 · Vokabular 32 768 · tied embeddings.
Trainingsdaten
Pretraining auf offen lizenzierten, quellseitig dokumentierten deutschen und englischen Quellen (EN gezielt für Mathematik, Wissenschaft, Bildung):
Chat-SFT: selbst erzeugt und CC0, gegen ein festes Prüfset dekontaminiert.
