atoof/fma-music-descriptions
π΅ Free Music Archive with Full Music Flamingo Descriptions A curated collection of 594 high-quality music tracks from the Free Music Archive, with complete semantic descriptions generated by NVIDIA's Music Flamingo model. β¨ What's New This dataset includes the full Music Flamingo descriptions, not just extracted tags. Each track has: π Complete textual description (mood, energy, instrumentation, production, use cases) π·οΈ Extracted semantic tags π΅ High-qualityβ¦ See the full description on the dataset page: https://huggingface.co/datasets/atoof/fma-music-descriptions.
π΅ Free Music Archive with Full Music Flamingo Descriptions
A curated collection of 594 high-quality music tracks from the Free Music Archive, with complete semantic descriptions generated by NVIDIA's Music Flamingo model.
β¨ What's New
This dataset includes the full Music Flamingo descriptions, not just extracted tags. Each track has:
- π Complete textual description (mood, energy, instrumentation, production, use cases)
- π·οΈ Extracted semantic tags
- π΅ High-quality audio (MP3)
- π Full attribution and licensing
π Dataset Summary
- Total Tracks: 594 music tracks
- Total Duration: ~20 hours of audio
- Format: MP3, embedded in Parquet
- Descriptions: Full Music Flamingo semantic descriptions
- Tags: 275 unique descriptive tags
- License: CC BY 4.0
π― Use Cases
- Audio Captioning: Train models to generate descriptions of music
- Music Generation: Condition generation models on detailed descriptions
- Audio-to-Text: Learn semantic understanding of music
- Text-to-Music: Use descriptions as training data for text-to-music models
- Music Information Retrieval: Semantic search and analysis
- Audio Classification: Tag prediction from audio
π Dataset Structure
Features
Example Description
- Mood: tense, ominous, suspenseful, claustrophobic, mysterious, unsettling, dramatic.
- Energy: low, slow, hypnotic, minimalistic.
- Instrumentation & production: sparse, deep subβbass, metallic textures, atmospheric drones,
resonant percussion (bottles/glasses), reverberant space, underscore/background music style.
- The track creates a dark, cinematic atmosphere perfect for suspenseful scenes, psychological
thrillers, or mysterious documentary sequences. The acoustic elements (bottles and glasses)
are heavily processed to create an otherworldly, tension-filled soundscape.π» Usage
Load the Dataset
from datasets import load_dataset
# Load the full dataset
dataset = load_dataset("parquet", data_files="train.parquet")
# Access an example
example = dataset["train"][0]
print("Title:", example["title"])
print("Description:", example["description"])
print("Tags:", example["tags"])
# Access audio
audio_array = example["audio"]["array"]
sample_rate = example["audio"]["sampling_rate"]Use Descriptions for Music Generation
from audiocraft.models import MusicGen
# Use full descriptions to generate similar music
model = MusicGen.get_pretrained('melody')
# Take a description from the dataset
description = dataset["train"][0]["description"]
wav = model.generate([description])Train Audio Captioning Model
# Use this dataset to train models that generate descriptions from audio
for example in dataset["train"]:
audio = example["audio"]["array"]
description = example["description"] # Ground truth description
tags = example["tags"] # Alternative: use tags
# Train your model hereSemantic Music Search
from sentence_transformers import SentenceTransformer
from sklearn.metrics.pairwise import cosine_similarity
# Encode all descriptions
model = SentenceTransformer('all-MiniLM-L6-v2')
descriptions = [ex["description"] for ex in dataset["train"]]
embeddings = model.encode(descriptions)
# Search with natural language
query = "dark cinematic orchestral music with tension and drama"
query_emb = model.encode([query])
similarities = cosine_similarity(query_emb, embeddings)
# Get top matches
top_idx = similarities[0].argsort()[-5:][::-1]
for idx in top_idx:
print(f"{dataset['train'][idx]['title']} by {dataset['train'][idx]['artist']}")π Dataset Statistics
- Total Tracks: 594
- Unique Artists: 44
- Total Tags: 5,962 tag instances
- Unique Tags: 275
- Average Tags per Track: ~9.3
- Average Description Length: ~500 characters
- Total Duration: ~20 hours
Top Tags
- dark (412 tracks)
- cinematic (363 tracks)
- tense (292 tracks)
- ambient (268 tracks)
- suspenseful (258 tracks)
π¬ Description Generation
The full descriptions were generated using NVIDIA's Music Flamingo model, which provides:
- Mood analysis: Emotional characteristics and atmosphere
- Energy assessment: Tempo, intensity, and pacing
- Instrumentation: Detailed breakdown of instruments and sounds
- Production style: Mixing, effects, and sonic characteristics
- Use case suggestions: Potential applications for the music
π License & Attribution
This dataset contains music from the Free Music Archive, licensed under Creative Commons Attribution 4.0 International (CC BY 4.0).
Attribution Required
When using this dataset:
- Provide attribution to original artists (in
attributionfield) - Link back to Free Music Archive
- Credit NVIDIA Music Flamingo for descriptions
- Indicate any modifications made
π Acknowledgments
- [Free Music Archive](https://freemusicarchive.org/): High-quality, openly licensed music
- Artists: All 44 artists who contributed their music
- [NVIDIA Music Flamingo](https://huggingface.co/nvidia/music-flamingo-2601-hf): State-of-the-art music understanding model
- Dataset Creator: Dataset curation and processing
π Citation
@dataset{fma_music_flamingo_2026,
title={Free Music Archive with Full Music Flamingo Descriptions},
author={Free Music Archive and NVIDIA},
year={2026},
publisher={Hugging Face},
howpublished={\url{https://huggingface.co/datasets/atoof/fma-music-descriptions}}
}Please also cite Music Flamingo:
@misc{music-flamingo-2601,
title={Music Flamingo: A Large-Scale Music Understanding Model},
author={NVIDIA},
year={2026},
howpublished={\url{https://huggingface.co/nvidia/music-flamingo-2601-hf}}
}π Links
Perfect for: Audio captioning research, music generation training, semantic music understanding, audio-to-text models
