CoolFace
Modelpublic

reciprocate/openllama-13b_rm_oasst-hh

sourceHugging Faceapache-2.0updated 3y agoView on Hugging Face
0likes15downloads
Model Card

OpenLLama-13B for reward modeling

  • —Dataset: https://huggingface.co/datasets/pvduy/rmoahh
  • —Logs: https://wandb.ai/sorry/autocrit/runs/j05t4e97?workspace=user-sorry
  • —Code: https://github.com/CarperAI/autocrit/blob/main/trainrewardmodel.py

Usage:

python
from transformers import AutoModelForSequenceClassification, AutoTokenizer

ckpt = "reciprocate/openllama-13b_rm_oasst-hh"
model = AutoModelForSequenceClassification.from_pretrained(ckpt, load_in_4bit=True)
tokenizer = AutoTokenizer.from_pretrained(ckpt)

model(**tokenizer("ASSISTANT: This sentence is a lie.", return_tensors="pt"))[0].item()

Output:

python
-1.626953125