models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
TR-HASH-MoE-100M-125B-Agentic-PretrainingTR-HASH-MoE-1B-70B-Agentic-Pretrainingdeep-ignorance-pretraining-stage-unfiltereddeep-ignorance-pretraining-stage-strong-filtertransformer-pretraining-from-scratchdeep-ignorance-pretraining-stage-weak-filterpretraining-priors-doormail4k-d32-treated-base100k_fineweb_continued_pretraining_Qwen2.5-0.5B-Instruct_Unsloth_merged_16bitpretraining-priors-d26-basepretraining-priors-d26-sftpretraining-priors-d26-sft-numtoxpretraining-priors-d26-base-numtox83k_continued_pretraining_Qwen2.5-0.5B-Instruct_Unsloth_merged_16bittrellis-pretraining10k_continued_pretraining_Qwen2.5-0.5B-Instruct_Unsloth_merged_16bittest_continued_pretraining_Phi-3-mini-4k-instruct_Unsloth_merged_16bit10k_continued_pretraining_Phi-3-mini-4k-instruct_Unsloth_merged_16bit40k_continued_pretraining_Qwen2.5-0.5B-Instruct_Unsloth_merged_16bitpretraining-priors-d26-rlen-t5-sci-continued-pretraining-487kpretraining-priors-d26-rl-numtox20260703_continual-pretraining-gpt2medium-step34000-nodecayAsclepius-Llama2-7B-Pretraining-OnlyAsclepius-Llama2-13B-Pretraining-OnlyPretrainingBasellama3kv3_plus3khelpfullnessGRPO1epochInstruct_2500_pretraining16bitpretrainingBaseLlama3kv3UrbanDensitypretrainingBaseQwen3kv3UrbanDensityLlama_3_2_1B_Filler_context_based_training_data_20251105_172125_DPO_preference_finetuned_dec10Instruct_2500_pretraining16bit_plusalpaca
