rockerritesh/smollm2-135m-fineweb-edu-200m
019
smollm2-135m-fineweb-edu-200m
A 135M parameter language model trained from scratch on FineWeb-Edu.
Model Description
Training Details
This model was trained from scratch (random initialization) for research purposes.
Training Data
- Dataset: FineWeb-Edu (sample-10BT split)
- Total tokens: ~200M (streamed)
Training Configuration
Training Curve
- Initial loss: ~10.9 (random)
- Final loss: 5.4439 (perplexity 231.3)
Limitations
- Not for production use: Trained on only 200M tokens (produces rough text)
- No instruction tuning: Base causal LM, not a chat model
- English only: Trained on English FineWeb-Edu data
Related Models
- `rockerritesh/gpt2-small-fineweb-edu-200m` — GPT-2 Small (124M, 12 layers)
- `rockerritesh/smollm2-135m-fineweb-edu-200m` — SmolLM2 (135M, 30 layers, Llama-style)
