CoolFace
Datasetpublic

baobabtech/water-conflict-classifier-evals

Water Conflict Classifier Evaluation Metrics Evaluation metrics tracking the performance of the Water Conflict Classifier across multiple training iterations and model configurations. Dataset Summary This dataset contains evaluation results from training runs of the Water Conflict Classifier, a multi-label SetFit model that identifies water-related conflict events in news headlines. Each row represents one model version with comprehensive performance metrics… See the full description on the dataset page: https://huggingface.co/datasets/baobabtech/water-conflict-classifier-evals.

sourceHugging Facecc-by-nc-4.0updated 10mo agoView on Hugging Face
0likes27downloads
Dataset Card

Water Conflict Classifier Evaluation Metrics

Evaluation metrics tracking the performance of the Water Conflict Classifier across multiple training iterations and model configurations.

Dataset Summary

This dataset contains evaluation results from training runs of the Water Conflict Classifier, a multi-label SetFit model that identifies water-related conflict events in news headlines. Each row represents one model version with comprehensive performance metrics across three classification labels: Trigger, Casualty, and Weapon.

Related Links:

Dataset Structure

Fields

FieldTypeDescription
versionstringModel version identifier (v1.0, v2.0, etc.)
timestampstringTraining completion timestamp
base_modelstringBase embedding model used
train_sizeintNumber of training examples
test_sizeintNumber of test examples
f1_microfloatMicro-averaged F1 score
f1_macrofloatMacro-averaged F1 score
accuracyfloatOverall accuracy
trigger_*floatPrecision/recall/F1 for Trigger label
casualty_*floatPrecision/recall/F1 for Casualty label
weapon_*floatPrecision/recall/F1 for Weapon label
model_repostringHuggingFace model repository

Model Versions

The dataset tracks performance across different configurations:

  • —Base models: BAAI/bge-small-en-v1.5, sentence-transformers/all-MiniLM-L6-v2
  • —Training strategies: undersampling for class balance
  • —Hyperparameter variations: batch size, epochs, sample size

Usage

python
from datasets import load_dataset

# Load the evaluation metrics
evals = load_dataset("baobabtech/water-conflict-classifier-evals")

# Compare model versions
import pandas as pd
df = pd.DataFrame(evals['train'])
print(df[['version', 'f1_macro', 'accuracy']].sort_values('f1_macro', ascending=False))

Citation

If you use this dataset or the Water Conflict Classifier in your research, please cite:

bibtex
@misc{baobab_water_conflict_classifier,
  author = {Mills, Olivier},
  title = {Water Conflict Classifier: Few-Shot Learning for Water-Related Conflict Event Detection},
  year = {2025},
  publisher = {Hugging Face},
  howpublished = {\url{https://huggingface.co/baobabtech/water-conflict-classifier}}
}

License

CC-BY-NC-4.0 (Non-commercial use only)

Contact

Olivier Mills Website: baobabtech.ai LinkedIn: oliviermills