gist-sparse-attention/GSA-PT-Llama-3.2-1B-chunk4-chunk4
033
GSA-PT-Llama-3.2-1B-chunk4-chunk4
This model is continued pretrained from meta-llama/Llama-3.2-1B using Gist Sparse Attention (GSA) with chunk size chunk4-chunk4.
Paper
GSA: Gist Sparse Attention via Learnable Compression and Selective Unfolding
