CoolFace
Datasetpublic

imerad-kv/r_judge_labelled

R-Judge with LLM-Judge Labels This dataset augments the R-Judge benchmark with automated safety labels produced by an LLM judge. R-Judge is a benchmark for evaluating the safety judgment capability of LLMs in multi-turn agent scenarios, spanning five application domains. Files File Description r_judge_data.csv Base dataset extracted from R-Judge (568 rows, deduplicated) r_judge_labelled_anthropic_claude-sonnet-4-6.csv Base dataset augmented with… See the full description on the dataset page: https://huggingface.co/datasets/imerad-kv/r_judge_labelled.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
0likes50downloads
16 commits on main
22650ce5mo ago

Create data.csv

imerad-kv
2ea3b555mo ago

Delete data.csv

imerad-kv
a3700a95mo ago

Create data.csv

imerad-kv
e98d9d05mo ago

Delete data.csv

imerad-kv
9790e055mo ago

Update README.md

imerad-kv
ab5949f5mo ago

Update README.md

imerad-kv
9443ba65mo ago

Update scripts/run_llm_judge.py

imerad-kv
3e582dc5mo ago

Update scripts/extract_to_csv.py

imerad-kv
54501975mo ago

Upload 3 files

imerad-kv
91306105mo ago

Delete r_judge_data copy

imerad-kv
8f3e9cb5mo ago

Upload 3 files

imerad-kv
2a53d8f5mo ago

Create README.md

imerad-kv
49226335mo ago

Create data.csv

Ibrahim Merad
f9b91025mo ago

Delete data.csv

Ibrahim Merad
428027b5mo ago

Create data.csv

Ibrahim Merad
5897f4a5mo ago

initial commit

Ibrahim Merad