bader
Datasets
All datasets matching “bader”SUB
SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions
This repository contains the dataset for the paper SUB: Benchmarking CBM Generalization via Synthetic Attribute Substitutions.
Code: https://github.com/ExplainableML/sub
SUB is a benchmark for testing concept-based interpretable models on their ability to generalize to novel combinations of known concepts. The benchmark comprises 38,400 images, each of which combines a base bird class with a single target… See the full description on the dataset page: https://huggingface.co/datasets/Jessica-bader/SUB.bader-alturki-qurancanarim-baderna-filteredscientific-en-ar-corpusCurated by Bader44
Ce dataset contient 1 573 paires de phrases parallèles extraites de rapports scientifiques et économiques de l'UNCTAD. Il est optimisé pour l'entraînement de modèles de traduction spécialisés.
Extraction : Utilisation de PyMuPDF pour extraire le texte des PDF techniques.
Alignement : Matching sémantique par IA avec un seuil de similarité de 0.88 pour garantir une précision maximale.
Nettoyage : Filtrage automatique des phrases incohérentes et des erreurs de segmentation.… See the full description on the dataset page: https://huggingface.co/datasets/Bader44/scientific-en-ar-corpus.test
