CoolFace
Modelpublic

keyvan-ai/Mankei-1B-Chat

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
1likes384downloads
Model Card

<p align="center"><img src="mankei-logo.png" width="200" alt="Mankei"></p>

Mankei-1B-Chat (experimentell)

Deutsches Chat-Sprachmodell mit 1,01 Mrd. Parametern, von Grund auf in Deutschland trainiert — eigener deutscher Tokenizer (32k), auf einer einzelnen Karte. Gebaut für den CPU-Betrieb, und die Grundlage der Mankei-326M-Embedder- und Mankei-326M-Reranker-Modelle.

Fähigkeiten

  • —Deutsche Faktenabfragen (z. B. „Hauptstadt von Bayern" → „München")
  • —Rückfrage bzw. Zurückhaltung bei Unsicherheit statt erfundener Antworten
  • —Flüssiges, grammatisches Deutsch

Benchmark — deutsches MMLU (deutsche From-Scratch-Modelle)

Multiple-Choice per Log-Likelihood auf deutschem MMLU, verglichen mit anderen von Grund auf trainierten deutschen Modellen (faire Klasse):

ModellGrößeAccuracy
Mankei-1B-Chat1,01 B23,0 %
gpt2-xl-wechsel-german1,56 B20,2 %
LLäMmlein-1B1,10 B20,0 %
german-gpt2 (dbmdz)0,12 B20,0 %

Mankei-1B führt das deutsche From-Scratch-Feld an. Kleine From-Scratch-Modelle liegen bei reinem Faktenwissen generell nahe dem Zufallsniveau (25 %) — Mankeis Stärke sind deutscher Sprachfluss und souveräner lokaler Betrieb, nicht der Wissens-Benchmark.

[image]

Verwendung

python
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
tok = AutoTokenizer.from_pretrained("keyvan-ai/Mankei-1B-Chat")
model = AutoModelForCausalLM.from_pretrained("keyvan-ai/Mankei-1B-Chat", dtype=torch.bfloat16)
msgs = [{"role": "user", "content": "Was ist die Hauptstadt von Bayern?"}]
ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt")
out = model.generate(ids, max_new_tokens=64, temperature=0.7, top_p=0.9,
                     repetition_penalty=1.15, do_sample=True)
print(tok.decode(out[0][ids.shape[1]:], skip_special_tokens=True))

Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.

Lokaler Betrieb (GGUF)

GGUF-Quantisierungen (f16 → Q3KM) direkt in diesem Repo — und gespiegelt im eigenen keyvan-ai/Mankei-1B-Chat-GGUF (Model-Tree):

bash
# Ollama
ollama run hf.co/keyvan-ai/Mankei-1B-Chat:Q4_K_M

# llama.cpp
llama-cli -hf keyvan-ai/Mankei-1B-Chat:Q4_K_M

Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.

Architektur

Llama-Architektur · 1,013 Mrd. Parameter · hidden 1536 · 32 Layer · 24/6 Heads (GQA) · SwiGLU · RMSNorm · RoPE θ 500 000 · Kontext 4096 · Vokabular 32 768 · tied embeddings.

Trainingsdaten

Pretraining auf offen lizenzierten, quellseitig dokumentierten deutschen und englischen Quellen (EN gezielt für Mathematik, Wissenschaft, Bildung):

QuelleDomäneLizenz
FineWeb2-HQDE Web (Top-Filter)ODC-BY 1.0
FinePDFsDE PDF-VolltextODC-BY 1.0
FineMathEN MathematikODC-BY 1.0
OpenWebMathEN MathematikODC-BY 1.0
FineWeb-EduEN Web (Bildung)ODC-BY 1.0
Wikipedia (de)DE EnzyklopädieCC-BY-SA 4.0
German CommonsDE Recht & WissenschaftODC-BY (Dokumente quellspezifisch)

Chat-SFT: selbst erzeugt und CC0, gegen ein festes Prüfset dekontaminiert.