fairdataihub/envision-eye-imaging-classifier-by-metadata
131
Envision Eye Imaging Classifier
SetFit binary classifier for identifying eye imaging datasets from scientific metadata.
Developed by: FAIR Data Innovations Hub in collaboration with the EyeACT Study
Model Description
Uses sentence-transformers/all-mpnet-base-v2 as backbone with binary classification:
- EYE_IMAGING (1): Actual ophthalmic imaging datasets (fundus, OCT, OCTA, cornea)
- NEGATIVE (0): Everything else (software, non-imaging eye data, unrelated)
Validation
Spot-check (33 expert-verified Zenodo records)
Held-out test set (20% stratified split)
Multi-repository spot-check (6,833 records across 6 sources)
Training
- Base model: sentence-transformers/all-mpnet-base-v2 (768-dimensional)
- Training data: 994 examples (365 EYE_IMAGING, 629 NEGATIVE) from multi-repository sources (Zenodo, Figshare, Dryad, Kaggle, NEI)
- Dataset: fairdataihub/envision-eye-imaging-training-data
- Epochs: 10 (early stopping, patience=3)
- Batch size: 16
- Learning rate: 2e-5 (default)
- Scheduler: linear with 10% warmup
Usage
from setfit import SetFitModel
model = SetFitModel.from_pretrained("fairdataihub/envision-eye-imaging-classifier")
predictions = model.predict(["Retinal OCT dataset for diabetic retinopathy"])Citation
- EyeACT Envision project
- FAIR Data Innovations Hub (fairdataihub.org)
- sentence-transformers/all-mpnet-base-v2
Contact
EyeACT team: eyeactstudy.org
Related Models
- envision-eye-imaging-classifier-by-image: image based modality classifier (RegNetY-400MF CPU student) that identifies the acquisition modality of an individual eye image from its pixels. The two models are complementary: this one flags whether a dataset is eye imaging from its text metadata, the image one identifies the modality of a given image.
- envision-eye-imaging-classifier-by-image-teacher: the ConvNeXt-Base teacher for the image model.
