CoolFace
Modelpublic

ZombitX64/MultiSent-E5-Pro

sourceHugging Facecc-by-nc-nd-4.0updated 1y agoView on Hugging Face
1likes16downloads
Model Card

๐ŸŽฏ MultiSent-E5-Pro: Advanced Thai Sentiment Classifier

<div align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/673eef9c4edfc6d3b58ba3aa/lQCMts9DEsjQf3Yd8wu4a.png" width="300" alt="MultiSent-E5-Pro Logo">

<strong>๐Ÿ‡น๐Ÿ‡ญ State-of-the-art Thai sentiment analysis with multilingual capabilities</strong>

<a href="https://creativecommons.org/licenses/by-nc-nd/4.0/"><img src="https://img.shields.io/badge/License-CCBY--NC--ND4.0-lightgrey.svg"></a> <a href="https://huggingface.co/ZombitX64/MultiSent-E5-Pro"><img src="https://img.shields.io/badge/๐Ÿค—%20HF-Model-yellow"></a> <a href="https://huggingface.co/ZombitX64/MultiSent-E5-Pro"><img src="https://img.shields.io/badge/Downloads-1K+-green"></a>

</div>

๐Ÿ“‹ Quick Overview

MultiSent-E5-Pro is a fine-tuned sentiment analysis model based on intfloat/multilingual-e5-large, specially optimized for Thai with support for multilingual contexts. The model classifies text into four categories: Positive, Negative, Neutral, and Question.

๐ŸŽฏ Key Features

  • โ€”Handles Thai-specific expressions, colloquialisms, and sarcasm effectively
  • โ€”Performs well on real-world social media & review data
  • โ€”Multilingual support for Southeast and East Asian languages

๐Ÿ† Benchmark Summary

RankModelAccuracyF1-MacroNotes
๐Ÿฅ‡ 1stMultiSent-E5-Pro84.61%84.61%Best overall
2ndMultiSent-E580.62%80.62%Baseline model
3rdsentiment-10357.40%49.87%Moderate baseline

๐Ÿ“Š Detailed Metrics (2,183 samples)

MetricScore
Accuracy84.61%
F1-Macro84.61%
F1-Weighted84.75%
Avg Confidence98.53%
Low Confidence Rate (<60%)0.96%

Per-Class Performance

ClassPrecisionRecallF1Notes
Negative91.0%84.6%87.7%Excellent
Positive83.0%94.3%88.3%Excellent
Neutral71.9%81.6%76.4%Moderate
Question94.4%79.0%86.0%Good

โšก Quick Start

python
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

model = "ZombitX64/MultiSent-E5-Pro"
tokenizer = AutoTokenizer.from_pretrained(model)
model = AutoModelForSequenceClassification.from_pretrained(model)

text = "เธœเธฅเธดเธ•เธ เธฑเธ“เธ‘เนŒเธ™เธตเน‰เธ”เธตเธกเธฒเธ เนƒเธŠเน‰เธ‡เธฒเธ™เธ‡เนˆเธฒเธข"
inputs = tokenizer(text, return_tensors="pt", truncation=True)
with torch.no_grad():
    outputs = model(**inputs)
    probs = torch.nn.functional.softmax(outputs.logits, dim=-1)
    predicted = torch.argmax(probs, dim=-1)

labels = ["Question", "Negative", "Neutral", "Positive"]
print(f"Sentiment: {labels[predicted.item()]} (Confidence: {probs[0][predicted].item():.2%})")

๐ŸŒŸ Use Cases

ApplicationSuitability
Product Reviews๐ŸŸข Excellent
Social Media๐ŸŸข Excellent
Customer Support๐ŸŸข Excellent
Content Moderation๐ŸŸก Good
Research Analysis๐ŸŸก Good

โš  Known Limitations

  • โ€”Sarcasm Misclassification (especially in Chinese)
  • โ€”Mixed Sentiments lean toward Neutral
  • โ€”Low recall for Question class due to limited data
  • โ€”Bias toward Positive due to class imbalance
  • โ€”Overconfidence in some multilingual predictions

๐Ÿ›  Technical Info

ConfigValue
Base Modelmultilingual-e5-large
Params\~1.02B
Classes4
Max Length512
Training Time\~27 min

Data Summary:

  • โ€”Training: 2,456 samples
  • โ€”Validation: 273 samples
  • โ€”Evaluation: 2,183 samples

๐Ÿ“„ Citation

bibtex
@misc{MultiSent-E5-Pro-2024,
  title={MultiSent-E5-Pro: Advanced Thai Sentiment Analysis},
  author={ZombitX64, Janutsaha K., Saengwichain C.},
  year={2024},
  url={https://huggingface.co/ZombitX64/MultiSent-E5-Pro},
  note={Hugging Face Model Card}
}
bibtex
@article{wang2024multilingual,
  title={Multilingual E5 Text Embeddings: A Technical Report},
  author={Wang, Liang and Yang, Nan and Huang, Xiaolong and Yang, Linjun and Majumder, Rangan and Wei, Furu},
  journal={arXiv preprint arXiv:2402.05672},
  year={2024}
}

๐Ÿ‘จโ€๐Ÿ’ผ Authors

RoleName
Lead DevZombitX64
Data ScientistKrittanut Janutsaha
EngineerChanyut Saengwichain

๐Ÿ˜Š Feedback & Contributions


<div align="center"> Last Updated: Dec 2024 | Version: 1.1 | Docs: v2.0 </div>