msaligs/ast_fine_tuned_music_genre_10
117
๐ต Music Genre Classification using AST
๐ Model Overview
This model is a fine-tuned Audio Spectrogram Transformer (AST) for music genre classification.
It predicts one of the following 10 genres:
- blues, classical, country, disco, hiphop
- jazz, metal, pop, reggae, rock
๐ง Architecture
- Base Model: MIT/ast-finetuned-audioset
- Type: Transformer (Audio Spectrogram Transformer)
- Framework: PyTorch + Hugging Face Transformers
๐ฏ Task
Audio Classification (Music Genre Classification)
๐ Dataset
- Training Data: Clean instrument stems (drums, vocals, bass, others)
- Test Data: Noisy mashups with:
- cross-song mixing
- tempo variation
- ESC-50 noise injection
โ๏ธ Preprocessing
- Sampling rate: 16kHz
- Fixed duration: 15 seconds
- Padding / truncation applied
- Feature extraction using ASTFeatureExtractor
๐ Performance
- Metric: Macro F1 Score
- Achieved: 0.87
๐ Live Demo
Try the model here: ๐ https://huggingface.co/spaces/msaligs/music-genre-classifier
๐ Usage
from transformers import ASTForAudioClassification, ASTFeatureExtractor
model = ASTForAudioClassification.from_pretrained("msaligs/ast_fine_tuned_music_genre_10")
feature_extractor = ASTFeatureExtractor.from_pretrained("msaligs/ast_fine_tuned_music_genre_10")