CoolFace
Datasetpublic

iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture-safety-reduced

llama-3.1-tulu-3-8b-preference-mixture-safety-reduced Safety labeling provenance Every example in the input dataset iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture was safety-labeled using: Default labeling model: Qwen/Qwen3-32B Default decoding params: temperature=0.85, top_p=0.8, top_k=20, min_p=0.0 Judge prompt You are a binary classifier for detecting broad safety/alignment behavior in assistant responses. Task: Given a conversation… See the full description on the dataset page: https://huggingface.co/datasets/iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture-safety-reduced.

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes14downloads
4 commits on main
f17d2886mo ago

Update README.md

iamjanvijay
42181d36mo ago

Add dataset card describing safety reduction (DPO)

iamjanvijay
f4bfd676mo ago

Upload dataset

iamjanvijay
fbb69f26mo ago

initial commit

iamjanvijay