CoolFace
Modelpublic

JonathanMiddleton/daisy-milli-base-v18d.e-tokens300001787904

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes21downloads
Model Card

DaisyCore — daisy_milli

Model Description

DaisyCore transformer with 26 layers, 14 attention heads, and a model dimension of 1,792. Uses block-causal sliding window attention (window size 2,048) with standard attention implementation.

Architecture

PropertyValue
ArchitectureDaisyCore
Layers26
Attention Heads14
Model Dimension1,792
Head Dimension128
Sliding Window Size2,048
Max Sequence Length131,072
Vocabulary Size49,152
Attention Implementationstandard
Value EmbeddingsTrue
Tied EmbeddingsFalse
Skip Mix Modelinear
Tokenizerjonathanmiddleton/daisy
Dtypebfloat16
Parameters (total)2,323,120,245
Parameters (non-embedding)1,001,914,485
Parameters (embedding)1,321,205,760

Training Progress

MetricValue
Checkpoint Step127,698
Tokens Processed300.00B (300,001,787,904)
Target Tokens300.00B (300,000,000,000)
Progress100.0%
Best Validation Loss2.07058
Evaluations Performed1510
Saved2026-03-08 16:46 UTC

Training Configuration

Optimizers

OptimizerParameter GroupLearning Rate
AdamWhead_params0.003216
AdamWembed_params0.1865
AdamWscalar_params0.02099
Muonhiddenmatrixparams0.025

Schedule & Regularization

ParameterValue
LR Scale1.0
LR Schedulenphaselinear
LR Schedule — beginafterfraction0.0
LR Schedule — cooldown_fraction0.0
LR Schedule — floor0.0
LR Schedule — phases[{'progress': 0.0, 'scale': 1.0}, {'progress': 0.36117676, 'scale': 0.20527}, {'progress': 1.0, 'scale': 0.1}]
LR Schedule — warmup_fraction0.0
Gradient Accumulation Steps8
Muon Warmup Steps300
Seed1337

Training Data

TypeSequence LengthPath
fineweb-edu-shuffled16,384data/fineweb-edu-shuffled/train/*.bin

Checkpoint Provenance

  • —Resumed from: JonathanMiddleton/daisy-milli-base-v18d.d

All Hyperparameters

ParameterValue
window_size2048
vocab_size49152
eostokenid49131
num_layers26
num_heads14
model_dim1792
head_dim128
maxseqlen131072
model_specdaisy_milli
model_classmodels.daisy.daisy_core.DaisyCore
target_tokens100000000000
fullwindowtarget_tokens3000000000
torchcoordinatedescent_tuningFalse
torchinductorconfigmaxautotuneFalse
overfitFalse
full_windowsFalse
wandb_logTrue
wandb_projectmilli
wandbrunnamemilli_v18d.e
wandb_grouppretrain
resume_checkpointJonathanMiddleton/daisy-milli-base-v18d.d
resumetargettokens_override300000000000
usevalueembeddingsTrue
usetiedembeddingsFalse
seed1337
taskvaldebuglogsamplesFalse
log_interval16384
muonwarmupsteps300
lr_scale1.0
cooldown_fraction0.0
lr_schedule{"name": "nphaselinear", "config": {"cooldownfraction": 0.0, "phases": [{"progress": 0.0, "scale": 1.0}, {"progress": 0.36117676, "scale": 0.20527}, {"progress": 1.0, "scale": 0.1}], "floor": 0.0, "warmupfraction": 0.0, "beginafterfraction": 0.0}}
gradaccsteps8
vallossevery_tokens262144000
checkpointwarmuptokens1
checkpointpern_tokens524288000
save_checkpointTrue
benchmarks_frequency2
mmlucachebin_pathdata/mmlucache/mmlucache.bin
mmlucachebin_rebuildFalse
task_trainingFalse
tracklastn_layers0