gist-sparse-attention/GSA-PT-Qwen2-7B-Instruct-chunk8-data
GSA-PT-Qwen2-7B-Instruct-chunk8-data This is the continue pretraining dataset used for training GSA (Gist Sparse Attention) models based on Qwen2-7B-Instruct with chunk size chunk8. Each sample is tokenized and formatted with GSA gist tokens for continue pretraining. Paper GSA: Gist Sparse Attention via Learnable Compression and Selective Unfolding Related Model yuzhenm/GSA-PT-Qwen2-7B-Instruct-chunk8 — model trained on this dataset
058
data-00000-of-00015.arrowdownload
data-00001-of-00015.arrowdownload
data-00002-of-00015.arrowdownload
data-00003-of-00015.arrowdownload
data-00004-of-00015.arrowdownload
data-00005-of-00015.arrowdownload
data-00006-of-00015.arrowdownload
data-00007-of-00015.arrowdownload
data-00008-of-00015.arrowdownload
data-00009-of-00015.arrowdownload
data-00010-of-00015.arrowdownload
data-00011-of-00015.arrowdownload
data-00012-of-00015.arrowdownload
data-00013-of-00015.arrowdownload
data-00014-of-00015.arrowdownload
