CoolFace
Modelpublic

halfrot/sft-mt5-base

sourceHugging Faceapache-2.0updated 3y agoView on Hugging Face
0likes751downloads
Model Card

Trained SFT policy for MT task in the paper "ALaRM: Align Language Models via Hierarchical Rewards Modeling".

Check out our project page for more information.