multilingual-classification
bert-base-multilingual-cased-finetuned-openalex-topic-classification-title-abstractmultilingual-emotion-classificationweb-register-classification-multilingualweb-register-classification-multilingual-bgemultilingual-bert-gender-classificationmultilingual-emotion-classificationdistilbert-multilingual-sdg-classificationtutorial-model-bert-base-multilingual-cased-japanese-github-classification
multilingual-sentiment-classification
MultilingualSentimentClassification
An MTEB dataset
Massive Text Embedding Benchmark
Sentiment classification dataset with binary
(positive vs negative sentiment) labels. Includes 30 languages and dialects.
Task category
t2c
DomainsReviews, Written
Reference
https://huggingface.co/datasets/mteb/multilingual-sentiment-classification
How to evaluate on this task
You can evaluate an embedding model on this dataset using the… See the full description on the dataset page: https://huggingface.co/datasets/mteb/multilingual-sentiment-classification.multilingual-scala-classification
ScalaClassification
An MTEB dataset
Massive Text Embedding Benchmark
ScaLa a linguistic acceptability dataset for the mainland Scandinavian languages automatically constructed from dependency annotations in Universal Dependencies Treebanks.
Published as part of 'ScandEval: A Benchmark for Scandinavian Natural Language Processing'
Task category
t2c
Domains
Fiction, News, Non-fiction, Blog, Spoken, Web, Written
Reference… See the full description on the dataset page: https://huggingface.co/datasets/mteb/multilingual-scala-classification.multilingual-safety-classification-dataset
Multilingual Safety Classification Dataset
A multilingual dataset for safety classification across 60 languages, created by Hasan Kurşun through machine translation of English safety prompts using NLLB-200-3.3B.
Dataset Details
Processed by: Hasan KurşunAuthor: Hasan KurşunYear: 2025Source Dataset: mvrcii/safety-moderation-benchmarkTranslation Model: facebook/nllb-200-3.3B
Languages (60)
African Languages (16): Amharic, Hausa, Kinyarwanda, Luganda… See the full description on the dataset page: https://huggingface.co/datasets/hasankursun/multilingual-safety-classification-dataset.multilingual-sentiment-vie-classification
MultiLingualSentiment_vie_Classification
Deduplicated copy of kornwtp/multilingual-sentiment-vie-classification.
Splits
split
rows
test
684
train
2,358
validation
330
multilingual-sentiment-tha-classification
MultiLingualSentiment_tha_Classification
Deduplicated copy of kornwtp/multilingual-sentiment-tha-classification.
Splits
split
rows
test
2,344
train
8,102
validation
1,153
toxicity-multilingual-binary-classification-datasetThis dataset is a comprehensive collection designed to aid in the development of robust and nuanced models for identifying toxic language across multiple languages, while critically distinguishing it from expressions related to mental health, specifically depression. It synthesizes content from three existing public datasets (ToxiGen, TextDetox, and Mental Health - Depression) with a newly generated synthetic dataset (ToxiLLaMA). The creation process involved careful collection, extensive… See the full description on the dataset page: https://huggingface.co/datasets/malexandersalazar/toxicity-multilingual-binary-classification-dataset.
turkish-zero-shot-text-classification-with-multilingual-modelsMultilingual-Zero-Shot-Sentiment-Classificationzero-shot-text-classification-with-multilingual-t5multilingual-text-classification-exampleMultilingual_Hierarchical_Ticket_Classification_NLP_Deep_LearningMultilingual_Hierarchical_Ticket_Classification
