CoolFace
Modelpublic

RegularizedSelfPlay/Llama-3-8B-Instruct-SPPO-Iter1-gp-8b-gpm-reg0.05-sppo-reversekl-table

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes16downloads
3 commits on main
7f23fd71y ago

Upload tokenizer

timxiaohangt
1aeee0b1y ago

Upload LlamaForCausalLM

timxiaohangt
60e5d741y ago

initial commit

timxiaohangt