adversarial-robustness
adversarial-robustness-dpo-100k
Adversarial Robustness DPO (100K)
100,000 DPO preference pairs for training models to recognize and resist adversarial attacks. Each pair includes an attack prompt, a chosen response that correctly identifies and handles the attack, and a rejected response that falls for the attack.
Covers 7 attack categories and 21 attack subtypes including prompt injection, jailbreaks, social engineering, persona attacks, indirect injection, obfuscation, and information extraction attacks.… See the full description on the dataset page: https://huggingface.co/datasets/stindardlogic/adversarial-robustness-dpo-100k.adversarial-vision-transformers-robustnesssynth_docs_honly_and_claude_situational_adversarial_robustnessrepro-a-coin-flip-for-safety-llm-judges-fail-to-reliably-measure-adversarial-robustness
Reproduction: A Coin Flip for Safety - LLM Judges Fail to Reliably Measure Adversarial Robustness
Paper Information
Title: A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness
OpenReview ID: RgnoWsmYBM
Conference: ICML 2026
Task: Evaluate 4 LLM-based safety judges on 6,642 human-verified adversarial prompts
Reproduction Summary
This paper's all 6 claims require LLM inference on proprietary adversarial prompts and… See the full description on the dataset page: https://huggingface.co/datasets/sabaridsnfuji/repro-a-coin-flip-for-safety-llm-judges-fail-to-reliably-measure-adversarial-robustness.
