CoolFace
Modelpublic

deqing/convergent-llama-300M-adamw-addition

sourceHugging Facemitupdated 6mo agoView on Hugging Face
0likes15downloads
Model Card

convergent-llama-300M-adamw-addition

A 300M-parameter language model trained from scratch on [deqing/addition_dataset](https://huggingface.co/datasets/deqing/addition_dataset) as part of the Convergent Evolution project, which investigates how Fourier features emerge in LLM number embeddings.

Model details

ArchitectureLLaMA-style Transformer (12 layers, 1024 hidden, 16 heads, GQA)
Parameters~300M
OptimizerAdamW
Data perturbationaddition-only data (e.g., '123 + 456 = 579')
Training datadeqing/addition_dataset
Context length1024
TokenizerLlama 3 (128K vocab)
Batch size512 sequences

Usage

python
from transformers import AutoModelForCausalLM

# Load final checkpoint
model = AutoModelForCausalLM.from_pretrained("deqing/convergent-llama-300M-adamw-addition")

Training dynamics

Intermediate checkpoints are saved as branches: tokens-200M, tokens-400M, ..., tokens-5.0B.

python
# Load intermediate checkpoint (e.g., at 1B tokens)
model = AutoModelForCausalLM.from_pretrained("deqing/convergent-llama-300M-adamw-addition", revision="tokens-1B")

Citation

Paper forthcoming.