JonathanMiddleton/daisy-milli-base-v18d.e-tokens258606104576
023
DaisyCore — daisy_milli
Model Description
DaisyCore transformer with 26 layers, 14 attention heads, and a model dimension of 1,792. Uses block-causal sliding window attention (window size 2,048) with standard attention implementation.
Architecture
Training Progress
Training Configuration
Optimizers
Schedule & Regularization
Training Data
Checkpoint Provenance
- Resumed from:
JonathanMiddleton/daisy-milli-base-v18d.d
