CoolFace
Modelpublic

Keshav0308/multilingual-topic-classifier

sourceHugging Facemitupdated 5mo agoView on Hugging Face
0likes10downloads
README.md68 linesDownload Raw Back to root
1---2language:3- multilingual4license: mit5tags:6- text-classification7- multilingual8- xlm-roberta9- topic-classification10datasets:11- Davlan/sib20012metrics:13- accuracy14- f115---16 17# 🌍 Multilingual Topic Classifier18 19A multilingual text classification model fine-tuned on the SIB-200 dataset, capable of classifying text into 7 topics across **205 languages**.20 21## Model Details22- **Base model:** xlm-roberta-base23- **Task:** Text Classification (Topic)24- **Languages:** 20525- **Developed by:** Keshav030826 27## Topics28| Label | Description |29|-------|-------------|30| 🌍 geography | Geographic content |31| 🔬 science/technology | Science and tech content |32| 🎬 entertainment | Entertainment content |33| 🏛️ politics | Political content |34| 🏥 health | Health and medical content |35| ✈️ travel | Travel content |36| ⚽ sports | Sports content |37 38## Performance39| Metric | Score |40|--------|-------|41| Test Accuracy | 69.17% |42| Test F1 Macro | 67.62% |43| Languages | 205 |44 45## Usage46 47```python48from transformers import pipeline49 50classifier = pipeline(51    "text-classification",52    model="Keshav0308/multilingual-topic-classifier"53)54 55# Works in any language!56classifier("The patient was diagnosed with pneumonia.")57# {'label': 'health', 'score': 0.999}58 59classifier("El equipo ganó el campeonato mundial de fútbol.")60# {'label': 'sports', 'score': 0.999}61```62 63## Training Data64Fine-tuned on [SIB-200](https://huggingface.co/datasets/Davlan/sib200) — a massively multilingual dataset with 205 languages.65 66- Train samples: 143,70567- Validation samples: 20,295  68- Test samples: 41,820