kmoss/qwen3-1.7b-traces
Qwen3-1.7B reasoning traces On-policy chain-of-thought rollouts from Qwen/Qwen3-1.7B in thinking mode, collected to study long-context KV-cache residency constraints (trainable sparse attention, in the InfLLM-V2 / NOSA line). Used as adaptation data: training a sparse+local attention variant on the model's own output distribution avoids the alignment tax that continued pretraining on external corpora imposes on a post-trained model. Caveats Not filtered for… See the full description on the dataset page: https://huggingface.co/datasets/kmoss/qwen3-1.7b-traces.
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload README.md with huggingface_hub
Upload dataset
Upload dataset
Upload README.md with huggingface_hub
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload README.md with huggingface_hub
Upload dataset
Upload README.md with huggingface_hub
Upload dataset
initial commit
