CoolFace
Modelpublic

gist-sparse-attention/GSA-PT-Qwen2-7B-Instruct-chunk16

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes102downloads
Model Card

GSA-PT-Qwen2-7B-Instruct-chunk16

This model is continued pretrained from Qwen/Qwen2-7B-Instruct using Gist Sparse Attention (GSA) with chunk size chunk16.

Paper

GSA: Gist Sparse Attention via Learnable Compression and Selective Unfolding

Model Details

FieldValue
Base modelQwen/Qwen2-7B-Instruct
Training typeContinued Pretraining
Chunk sizechunk16
ArchitectureQwen2-7B