models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
adamw-model-testHebrewGPT-1B-AdamWconvergent-mamba2-300M-adamw-originalv53_Large_AdaMWv54_Large_AdaMWnanochat-adamWbatch1_epochs1_lr1e-05_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu32commonsense-adamw-seed0fwe-1b-adamw-step100000ALE-GPT-llama2-7B-1562-int8-lora256-constant-adamw8bitadamwathanbatch1_epochs4_lr1e-05_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu16distilgpt2-finetuned-wikitext2batch1_epochs4_lr1e-05_paged_adamw_32bit_cosine_len2048_warm0.05_grad1.0_accu16_neft5HumanAssistanceResults_8_CAUSAL_LM_tbs2_lr0.0002_optimpaged_adamw_32bitconvergent-gdn-300M-adamw-originalQwen2.5-0.5B_adamw_v2batch1_epochs4_lr1e-05_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu32batch1_epochs4_lr1e-05_paged_adamw_32bit_cosine_len2048_warm0.05_grad1.0_accu10_neft5adamw-r0_0005-100bsweep-nep-sft_lfm2.5-1.2b_lora_r16a16_lr2e4_wd0.01_adamw-torch-fused_cosine_commitpackftconvergent-llama-300M-adamw-window_2batch1_epochs2_lr1e-05_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu32sweep-nep-sft_lfm2.5-1.2b_lora_r16_lr2e4_wd0.01_adamw-torch-fused_cosineconvergent-llama-300M-adamw-swap_numbersconvergent-llama-300M-adamw-additionbatch1_epochs4_lr1e-06_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu16batch1_epochs4_lr0.0001_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu16batch1_epochs4_lr1e-05_paged_adamw_32bit_cosine_length2048_warmup_0.05_max_grad1.0_grad_accu16batch1_epochs4_lr1e-05_paged_adamw_32bit_cosine_len2048_warm0.05_grad1.0_accu10_neftNone
