ZombitX64/MultiSent-E5-Pro
๐ฏ MultiSent-E5-Pro: Advanced Thai Sentiment Classifier
<div align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/673eef9c4edfc6d3b58ba3aa/lQCMts9DEsjQf3Yd8wu4a.png" width="300" alt="MultiSent-E5-Pro Logo">
<strong>๐น๐ญ State-of-the-art Thai sentiment analysis with multilingual capabilities</strong>
<a href="https://creativecommons.org/licenses/by-nc-nd/4.0/"><img src="https://img.shields.io/badge/License-CCBY--NC--ND4.0-lightgrey.svg"></a> <a href="https://huggingface.co/ZombitX64/MultiSent-E5-Pro"><img src="https://img.shields.io/badge/๐ค%20HF-Model-yellow"></a> <a href="https://huggingface.co/ZombitX64/MultiSent-E5-Pro"><img src="https://img.shields.io/badge/Downloads-1K+-green"></a>
</div>
๐ Quick Overview
MultiSent-E5-Pro is a fine-tuned sentiment analysis model based on intfloat/multilingual-e5-large, specially optimized for Thai with support for multilingual contexts. The model classifies text into four categories: Positive, Negative, Neutral, and Question.
๐ฏ Key Features
- Handles Thai-specific expressions, colloquialisms, and sarcasm effectively
- Performs well on real-world social media & review data
- Multilingual support for Southeast and East Asian languages
๐ Benchmark Summary
๐ Detailed Metrics (2,183 samples)
Per-Class Performance
โก Quick Start
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
model = "ZombitX64/MultiSent-E5-Pro"
tokenizer = AutoTokenizer.from_pretrained(model)
model = AutoModelForSequenceClassification.from_pretrained(model)
text = "เธเธฅเธดเธเธ เธฑเธเธเนเธเธตเนเธเธตเธกเธฒเธ เนเธเนเธเธฒเธเธเนเธฒเธข"
inputs = tokenizer(text, return_tensors="pt", truncation=True)
with torch.no_grad():
outputs = model(**inputs)
probs = torch.nn.functional.softmax(outputs.logits, dim=-1)
predicted = torch.argmax(probs, dim=-1)
labels = ["Question", "Negative", "Neutral", "Positive"]
print(f"Sentiment: {labels[predicted.item()]} (Confidence: {probs[0][predicted].item():.2%})")๐ Use Cases
โ Known Limitations
- Sarcasm Misclassification (especially in Chinese)
- Mixed Sentiments lean toward Neutral
- Low recall for Question class due to limited data
- Bias toward Positive due to class imbalance
- Overconfidence in some multilingual predictions
๐ Technical Info
Data Summary:
- Training: 2,456 samples
- Validation: 273 samples
- Evaluation: 2,183 samples
๐ Citation
@misc{MultiSent-E5-Pro-2024,
title={MultiSent-E5-Pro: Advanced Thai Sentiment Analysis},
author={ZombitX64, Janutsaha K., Saengwichain C.},
year={2024},
url={https://huggingface.co/ZombitX64/MultiSent-E5-Pro},
note={Hugging Face Model Card}
}@article{wang2024multilingual,
title={Multilingual E5 Text Embeddings: A Technical Report},
author={Wang, Liang and Yang, Nan and Huang, Xiaolong and Yang, Linjun and Majumder, Rangan and Wei, Furu},
journal={arXiv preprint arXiv:2402.05672},
year={2024}
}๐จโ๐ผ Authors
๐ Feedback & Contributions
- ๐ฌ Open Discussion
- ๐ Report Issue
- ๐ Star the repo if useful!
<div align="center"> Last Updated: Dec 2024 | Version: 1.1 | Docs: v2.0 </div>
