lenamerkli/distilled-web
Dataset Card for lenamerkli/distilled-web This dataset consists of web-scraped data using a custom crawler purpose-built for each website. Dataset Details Dataset Sources Repository: https://github.com/lenamerkli/distilled-web Uses This dataset is useful for training large language models. The train split provides instruction-following and chat data for supervised fine-tuning (SFT) and instruction tuning. The pretrain split… See the full description on the dataset page: https://huggingface.co/datasets/lenamerkli/distilled-web.
41.1k
1*.7z filter=lfs diff=lfs merge=lfs -text2*.arrow filter=lfs diff=lfs merge=lfs -text3*.avro filter=lfs diff=lfs merge=lfs -text4*.bin filter=lfs diff=lfs merge=lfs -text5*.bz2 filter=lfs diff=lfs merge=lfs -text6*.ckpt filter=lfs diff=lfs merge=lfs -text7*.ftz filter=lfs diff=lfs merge=lfs -text8*.gz filter=lfs diff=lfs merge=lfs -text9*.h5 filter=lfs diff=lfs merge=lfs -text10*.joblib filter=lfs diff=lfs merge=lfs -text11*.lfs.* filter=lfs diff=lfs merge=lfs -text12*.lz4 filter=lfs diff=lfs merge=lfs -text13*.mds filter=lfs diff=lfs merge=lfs -text14*.mlmodel filter=lfs diff=lfs merge=lfs -text15*.model filter=lfs diff=lfs merge=lfs -text16*.msgpack filter=lfs diff=lfs merge=lfs -text17*.npy filter=lfs diff=lfs merge=lfs -text18*.npz filter=lfs diff=lfs merge=lfs -text19*.onnx filter=lfs diff=lfs merge=lfs -text20*.ot filter=lfs diff=lfs merge=lfs -text21*.parquet filter=lfs diff=lfs merge=lfs -text22*.pb filter=lfs diff=lfs merge=lfs -text23*.pdf filter=lfs diff=lfs merge=lfs -text24*.pickle filter=lfs diff=lfs merge=lfs -text25*.pkl filter=lfs diff=lfs merge=lfs -text26*.pt filter=lfs diff=lfs merge=lfs -text27*.pth filter=lfs diff=lfs merge=lfs -text28*.rar filter=lfs diff=lfs merge=lfs -text29*.safetensors filter=lfs diff=lfs merge=lfs -text30saved_model/**/* filter=lfs diff=lfs merge=lfs -text31*.tar.* filter=lfs diff=lfs merge=lfs -text32*.tar filter=lfs diff=lfs merge=lfs -text33*.tflite filter=lfs diff=lfs merge=lfs -text34*.tgz filter=lfs diff=lfs merge=lfs -text35*.wasm filter=lfs diff=lfs merge=lfs -text36*.xz filter=lfs diff=lfs merge=lfs -text37*.zip filter=lfs diff=lfs merge=lfs -text38*.zst filter=lfs diff=lfs merge=lfs -text39*tfevents* filter=lfs diff=lfs merge=lfs -text40# Audio files - uncompressed41*.pcm filter=lfs diff=lfs merge=lfs -text42*.sam filter=lfs diff=lfs merge=lfs -text43*.raw filter=lfs diff=lfs merge=lfs -text44# Audio files - compressed45*.aac filter=lfs diff=lfs merge=lfs -text46*.flac filter=lfs diff=lfs merge=lfs -text47*.mp3 filter=lfs diff=lfs merge=lfs -text48*.ogg filter=lfs diff=lfs merge=lfs -text49*.wav filter=lfs diff=lfs merge=lfs -text50# Image files - uncompressed51*.bmp filter=lfs diff=lfs merge=lfs -text52*.gif filter=lfs diff=lfs merge=lfs -text53*.png filter=lfs diff=lfs merge=lfs -text54*.tiff filter=lfs diff=lfs merge=lfs -text55# Image files - compressed56*.jpg filter=lfs diff=lfs merge=lfs -text57*.jpeg filter=lfs diff=lfs merge=lfs -text58*.webp filter=lfs diff=lfs merge=lfs -text59# Video files - compressed60*.mp4 filter=lfs diff=lfs merge=lfs -text61*.webm filter=lfs diff=lfs merge=lfs -text62 