SlayerLab/pollock-mini-lm-125m
Pollock 1.6 - r008
![]()
Wydanie eksperymentalne / Experimental release. Model nie jest przeznaczony do zastosowań produkcyjnych ani wysokiego ryzyka. Cały model pozostaje poniżej 128M parametrów. / The model is not intended for production or high-risk use. The complete model remains below 128M parameters.
Polski
Opis
Pollock to niewielki, anglojęzyczny model bazowy typu decoder-only, wytrenowany od zera jako czytelny eksperyment edukacyjny. Implementacja bazuje na nanoGPT i własnym tokenizerze byte-level BPE. Jest to model do uzupełniania tekstu, nie asystent konwersacyjny.
R008 zastępuje klasyczny blok GELU MLP blokiem SwiGLU dopasowanym do tego samego budżetu poniżej 128M parametrów. Tokenizer, korpus, kontekst, liczba warstw, szerokość modelu, attention i effective batch pozostają zgodne z R007. Pełna historia techniczna znajduje się w `training-history/r008.md`, a różnice między wydaniami w `CHANGELOG.md`.
Architektura i tokenizer
Model używa własnej klasy Transformers PollockForCausalLM, ponieważ standardowy GPT2LMHeadModel nie implementuje tego wariantu SwiGLU. Wybrany checkpoint z aktualizacji 32 000 ma SHA-256 25b8cac7d5142c75e1be0b42fa24d980896e6f911e912c883566747a3baa56f0. Konwersja w Transformers 5.15.1 wykazała maksymalną bezwzględną różnicę logits 0.0 na deterministycznej próbie [2, 64]. SHA-256 pliku model.safetensors to 1c1002909119b4913841ee29efd44bd86d62d81f2ae27de01602b64d4af0dbec. Artefakt Transformers ma 127 975 936 parametrów, w tym zerowe tensory bias wymagane przez implementację pakietową; model natywny ma 127 820 544 parametrów.
Muon optymalizuje kwalifikujące się ukryte macierze attention i MLP. AdamW obsługuje embeddingi tokenów, powiązaną głowicę wyjściową, parametry normalizacji i biasy. Podział parametrów jest sprawdzany przed treningiem pod kątem nakładania się i kompletności.
Dane i trening
Model jest trenowany na `SlayerLab/minimal-en-corpus-5b` przypiętym do commita 38bebbd. Jest to subiektywnie dobrana mieszanka 15 anglojęzycznych źródeł po filtrowaniu języka, deduplikacji dokładnej i przybliżonej oraz decontaminacji benchmarków. R008 zachowuje tokenizer R007.
Loader stosuje globalną permutację ze stałym seedem do niezmiennych okien tokenów w każdym przebiegu, przydziela rozłączne pozycje między rangi DDP, maskuje końcowy niepełny batch i zapisuje globalny kursor, topologię oraz ustawienia tasowania w każdym checkpoincie.
Pierwsze dwa przebiegi zakończyły się na aktualizacji 21 959. Pierwotna kontynuacja odziedziczyła z R007 zbyt wysokie dla tej architektury dolne LR 1e-3 i 3e-5: pogorszyły się jednocześnie train-eval i pełny validation loss, a norma parametrów spadła o około 6,5%. Kontynuację zatrzymano na aktualizacji 34 520. Finalny trening R008 rozpoczęto ponownie z niezmienionego, zweryfikowanego checkpointu E2, obniżając oba LR dziesięciokrotnie i pozostawiając weight decay bez zmian. Validation loss osiągnął minimum 2.4507743919 przy aktualizacji 32 000, a następnie przeszedł w plateau i wzrósł do 2.4516 przy ostatnim zapisanym checkpoincie 38 000. Trening zatrzymano celowo przy aktualizacji 38 140; checkpoint 32 000 wybrano przed benchmarkami downstream.
Ewaluacja
Loss treningowy jest szacowany na stałej, tasowanej próbie 2 457 600 tokenów z całego splitu treningowego. Każda ewaluacja walidacyjna obejmuje pełny split, czyli 5 238 222 targety. Wybrany checkpoint ma train-eval loss 2.4182 oraz pełny validation loss 2.4507743919.
Wyniki pochodzą z pełnych splitów, zero-shot, w lm-eval 0.4.12, Transformers 5.15.1 i PyTorch 2.8.0+cu128 na RTX A4500. Tabela model-card używa BF16, batch 8 i maksymalnego kontekstu 1 024. Tiny-ML WikiText-2 osiąga byte perplexity 1.9423491827, 0.9578025823 bits/byte i word perplexity 34.8189798815. Kanoniczny Open SLM FP32 Intelligence Index wynosi 13.4419562655; pełne wyniki, próbki i protokół są powiązane z tym samym hashem modelu.
Stałe, nieprzebierane próbki generacji z seedem 1337 są zachowane razem z artefaktami ewaluacji. Pokazują również typowe ograniczenia małego modelu bazowego, w tym powtórzenia i błędy faktograficzne.
Pełne publiczne podsumowanie znajduje się w `benchmarks/english.json`, a próbki i skrypt odtwarzający w `inference-samples/r008/`.
Użycie z Transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "SlayerLab/pollock-mini-lm-125m"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
trust_remote_code=True,
)
inputs = tokenizer("Once upon a time", return_tensors="pt")
output = model.generate(
**inputs,
max_new_tokens=100,
do_sample=True,
temperature=0.7,
top_k=50,
)
print(tokenizer.decode(output[0], skip_special_tokens=True))trust_remote_code=True jest wymagane, ponieważ repozytorium zawiera małą, audytowalną implementację własnego bloku SwiGLU. Przed użyciem należy przejrzeć modeling_pollock.py w przypiętej rewizji modelu.
Ograniczenia i odpowiedzialne użycie
- Jest to surowy model bazowy bez instruction tuningu, RLHF ani alignmentu.
- Może halucynować oraz generować treści toksyczne, stronnicze, niebezpieczne lub podobne do danych treningowych.
- Mały rozmiar ogranicza wiedzę, rozumowanie, spójność długiego tekstu i jakość kodu.
- Model trenowano i oceniano głównie po angielsku.
- Nie należy używać go do porad medycznych, prawnych i finansowych, decyzji o ludziach ani zastosowań wysokiego ryzyka.
- Użytkownik odpowiada za ocenę warunków źródeł danych dla swojego zastosowania.
English
Overview
Pollock is a small English decoder-only base language model trained from scratch as a readable educational experiment. It is based on nanoGPT and a custom byte-level BPE tokenizer. It is a completion model, not a conversational assistant.
R008 replaces the GELU MLP with a parameter-matched SwiGLU block while retaining R007's tokenizer, corpus, learned absolute positions, context, layer count, model width, attention configuration, and effective batch. See `training-history/r008.md` for the technical record and `CHANGELOG.md` for release-to-release changes.
Architecture and tokenizer
The artifact uses the custom PollockForCausalLM Transformers class because standard GPT2LMHeadModel does not implement this SwiGLU variant. The selected step-32,000 checkpoint was converted with a maximum absolute native/Transformers logit difference of 0.0. Its SHA-256 is 25b8cac7d5142c75e1be0b42fa24d980896e6f911e912c883566747a3baa56f0; the resulting model.safetensors SHA-256 is 1c1002909119b4913841ee29efd44bd86d62d81f2ae27de01602b64d4af0dbec.
Data and training
The model is trained on `SlayerLab/minimal-en-corpus-5b`, pinned to commit 38bebbd. The deterministic loader, four-pass target, 491,520-target effective batch, and validation protocol match the Polish section.
The first two passes ended at update 21,959. The initial continuation inherited R007-derived floor learning rates that proved too high for this architecture: fixed train-eval and full-validation loss both degraded while parameter norm fell by about 6.5%. It was stopped at update 34,520. Final R008 training restarted from the unchanged, checksum-verified E2 checkpoint with fixed Muon and AdamW learning rates reduced by 10x to 1e-4 and 3e-6; weight decay remained 1e-2. Full-validation loss reached its minimum of 2.4507743919 at step 32,000 after 15,728,561,562 target presentations. Training was intentionally stopped at step 38,140 after the metric plateaued; the preselected best-validation checkpoint was then used for all release benchmarks.
Evaluation
The model-index and Polish table report the complete zero-shot standard suite. Evaluation used full splits with lm-eval 0.4.12, Transformers 5.15.1, PyTorch 2.8.0+cu128, and the exact converted model identified above. Tiny-ML WikiText-2 word perplexity is 34.8189798815. The canonical FP32 Open SLM scores are HellaSwag 30.4521%, ARC-Easy 42.3401%, ARC-Challenge 24.5734%, PIQA 61.0990%, ArithMark-3 34.6000%, and Intelligence Index 13.4419562655. The machine-readable summary is available at `benchmarks/english.json`, and the fixed samples plus replay script at `inference-samples/r008/`.
Usage
Use the Transformers example in the Polish section. Loading requires trust_remote_code=True; review modeling_pollock.py at the pinned model revision before use.
Limitations and responsible use
- This is a raw base model without instruction tuning, RLHF, or safety alignment.
- It may hallucinate and generate toxic, biased, unsafe, or training-like text.
- Its small size limits knowledge, reasoning, long-form coherence, and code quality.
- It was trained and evaluated primarily in English.
- Do not use it for medical, legal, financial, high-impact, or production decisions without independent safeguards.
- Users must evaluate upstream dataset terms for their intended use.
Licencja / License
Kod nanoGPT jest na licencji MIT. Korpus łączy źródła o różnych warunkach i nie ma jednej wspólnej licencji, dlatego model oznaczono jako license: other. Szczegóły: `LICENSE.md` i karta datasetu.
nanoGPT code is MIT-licensed. The corpus combines sources governed by different terms and has no single common license, so the model is marked as license: other. See `LICENSE.md` and the dataset card.
Pochodzenie / Attribution
Model i dataset / Model and dataset: Dawid Majewski / SlayerLab. Trening bazuje na / Training is based on karpathy/nanoGPT.
