Keshav0308/multilingual-topic-classifier
09
π Multilingual Topic Classifier
A multilingual text classification model fine-tuned on the SIB-200 dataset, capable of classifying text into 7 topics across 205 languages.
Model Details
- Base model: xlm-roberta-base
- Task: Text Classification (Topic)
- Languages: 205
- Developed by: Keshav0308
Topics
Performance
Usage
from transformers import pipeline
classifier = pipeline(
"text-classification",
model="Keshav0308/multilingual-topic-classifier"
)
# Works in any language!
classifier("The patient was diagnosed with pneumonia.")
# {'label': 'health', 'score': 0.999}
classifier("El equipo ganΓ³ el campeonato mundial de fΓΊtbol.")
# {'label': 'sports', 'score': 0.999}Training Data
Fine-tuned on SIB-200 β a massively multilingual dataset with 205 languages.
- Train samples: 143,705
- Validation samples: 20,295
- Test samples: 41,820
