FlowRank/mailSort
0
mailSort
Classifieur d’e-mails 20 classes (catégorie + urgence), basé sur DistilBERT.
Entraîné sur `FlowRank/labeled_emails` (révision main, ~19,8k exemples). Accuracy test : 96,01 % (1 900 / 1 979).
Labels (v2)
Chaque catégorie est déclinée en _urgent / _not_urgent : family, finance, games, human resources, medical, pets, school, software engineering, sport, work/airbus.
Inférence
from transformers import AutoModelForSequenceClassification, AutoTokenizer, pipeline
tok = AutoTokenizer.from_pretrained("FlowRank/mailSort", subfolder="model")
model = AutoModelForSequenceClassification.from_pretrained("FlowRank/mailSort", subfolder="model")
clf = pipeline("text-classification", model=model, tokenizer=tok, truncation=True)
text = "Subject: Insurance claim\n\nBody: I need to update my policy urgently."
print(clf(text))Développement local
Repo Python minimal pour entraîner, évaluer et publier. Le script principal est mailsort.train.
Par défaut, le code charge la dernière version du dataset (FlowRank/labeled_emails@main).
Installation
uv syncEntraîner + évaluer
uv run python -m mailsort.train \
--model-name distilbert-base-uncased \
--hub-model-id FlowRank/mailSort \
--num-train-epochs 2Pour épingler une version précise du dataset :
uv run python -m mailsort.train --dataset-revision v1.0Évaluer le modèle publié
uv run python -m mailsort.eval --split testÉvalue par défaut FlowRank/mailSort (sous-dossier model/) sur FlowRank/labeled_emails@main.
Publier via Git (README + model/)
uv run python -m mailsort.prepare_model --outputs-dir outputs --model-dir model
git add README.md model
git commit -m "chore(model): update published artifacts"
git pushLe push Hub automatique via Trainer nécessite HF_TOKEN :
export HF_TOKEN="..."
uv run python -m mailsort.train --hub-model-id FlowRank/mailSort