gist-sparse-attention/GSA-FT-Qwen2-7B-Instruct-chunk8-chunk4
0161
GSA-FT-Qwen2-7B-Instruct-chunk8-chunk4
This model is fine-tuned from gist-sparse-attention/GSA-PT-Qwen2-7B-Instruct-chunk8-chunk4 using Gist Sparse Attention (GSA) with chunk size chunk8-chunk4.
Paper
GSA: Gist Sparse Attention via Learnable Compression and Selective Unfolding
