iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture-safety-reduced
llama-3.1-tulu-3-8b-preference-mixture-safety-reduced Safety labeling provenance Every example in the input dataset iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture was safety-labeled using: Default labeling model: Qwen/Qwen3-32B Default decoding params: temperature=0.85, top_p=0.8, top_k=20, min_p=0.0 Judge prompt You are a binary classifier for detecting broad safety/alignment behavior in assistant responses. Task: Given a conversation… See the full description on the dataset page: https://huggingface.co/datasets/iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture-safety-reduced.
014
