CoolFace
Modelpublic

Remlemon/yourmt3-vocal-enhanced

sourceHugging Faceupdated 5mo agoView on Hugging Face
1likes211downloads
Model Card

A MIDI transcription model focuses on vocal, fine-tuned on the MIR-ST500 Chinese vocal.

Files

  • model.pt - inference weights.
  • config.json - model/audio/task configuration.
  • r47b_infer.py - local vocal stem to MIDI CLI.
  • runtime_deps/, yourmt3_train_src/ - minimal runtime source.

Usage

bash
pip install -r requirements.txt
python r47b_infer.py vocals.wav --output-midi vocals.mid --device cuda

Input should be a separated vocal stem.

Metrics

Metrics are reported on MIR-ST500 vocal transcription splits; this model repo does not include dataset audio or labels.

RouteSplitCOnP-F1COn-F1COnPOff-F1
r47b direct model.ptofficial820.68823757970.68823757970.5143113621
r47b + E12 single-sourceofficial820.71817163620.76249819920.5220578867
r47b + E12 single-sourcetrain337/calib0.74688275450.77443804150.5575166125