anna-sarvam/indic-safety-eval
IndicSafetyBench Multi-turn safety evaluation benchmark for Indian languages. Tests models against 30 jailbreak techniques across 19 India-specific harm domains in 23 languages with 189 dialect varieties. Stats 3,374 benchmark items 30 jailbreak techniques across 8 families 19 India harm domains (territorial, caste, religious, political, gender, etc.) 14 global harm categories (aligned with AILuminate v1.0 / Llama Guard 4) 23 languages (22 Indic + English) ~29%… See the full description on the dataset page: https://huggingface.co/datasets/anna-sarvam/indic-safety-eval.
092
