textdetox/twitter-xlmr-toxicity-classifier
0754
Multilingual Toxicity Classifier for 15 Languages (2025)
This is an instance of cardiffnlp/twitter-xlm-roberta-large-2022 that was fine-tuned on binary toxicity classification task based on our updated (2025) dataset textdetox/multilingual_toxicity_dataset.
Now, the models covers 15 languages from various language families:
How to use
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained('textdetox/twitter-xlmr-toxicity-classifier')
model = AutoModelForSequenceClassification.from_pretrained('textdetox/twitter-xlmr-toxicity-classifier')
batch = tokenizer.encode("You are amazing!", return_tensors="pt")
output = model(batch)
# idx 0 for neutral, idx 1 for toxicCitation
The model is prepared for TextDetox 2025 Shared Task evaluation.
Citation TBD soon.
