CoolFace
Datasetpublic

atoof/fma-music-descriptions

🎡 Free Music Archive with Full Music Flamingo Descriptions A curated collection of 594 high-quality music tracks from the Free Music Archive, with complete semantic descriptions generated by NVIDIA's Music Flamingo model. ✨ What's New This dataset includes the full Music Flamingo descriptions, not just extracted tags. Each track has: πŸ“ Complete textual description (mood, energy, instrumentation, production, use cases) 🏷️ Extracted semantic tags 🎡 High-quality… See the full description on the dataset page: https://huggingface.co/datasets/atoof/fma-music-descriptions.

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
0likes41downloads
Dataset Card

🎡 Free Music Archive with Full Music Flamingo Descriptions

A curated collection of 594 high-quality music tracks from the Free Music Archive, with complete semantic descriptions generated by NVIDIA's Music Flamingo model.

✨ What's New

This dataset includes the full Music Flamingo descriptions, not just extracted tags. Each track has:

  • β€”πŸ“ Complete textual description (mood, energy, instrumentation, production, use cases)
  • β€”πŸ·οΈ Extracted semantic tags
  • β€”πŸŽ΅ High-quality audio (MP3)
  • β€”πŸ“œ Full attribution and licensing

πŸ“Š Dataset Summary

  • β€”Total Tracks: 594 music tracks
  • β€”Total Duration: ~20 hours of audio
  • β€”Format: MP3, embedded in Parquet
  • β€”Descriptions: Full Music Flamingo semantic descriptions
  • β€”Tags: 275 unique descriptive tags
  • β€”License: CC BY 4.0

🎯 Use Cases

  • β€”Audio Captioning: Train models to generate descriptions of music
  • β€”Music Generation: Condition generation models on detailed descriptions
  • β€”Audio-to-Text: Learn semantic understanding of music
  • β€”Text-to-Music: Use descriptions as training data for text-to-music models
  • β€”Music Information Retrieval: Semantic search and analysis
  • β€”Audio Classification: Tag prediction from audio

πŸ“ Dataset Structure

Features

FeatureTypeDescription
audioAudioAudio data (MP3 format, various sample rates)
titlestringTrack title
artiststringArtist name
descriptionstringFull Music Flamingo description (mood, energy, instrumentation, etc.)
tagslist[string]Extracted semantic tags from description
genre_tagslist[string]Original genre classifications from FMA
track_idstringFree Music Archive track ID
original_pagestringLink to original FMA page
attributionstringLicense and attribution information

Example Description

- Mood: tense, ominous, suspenseful, claustrophobic, mysterious, unsettling, dramatic.
- Energy: low, slow, hypnotic, minimalistic.
- Instrumentation & production: sparse, deep sub‑bass, metallic textures, atmospheric drones,
  resonant percussion (bottles/glasses), reverberant space, underscore/background music style.
- The track creates a dark, cinematic atmosphere perfect for suspenseful scenes, psychological
  thrillers, or mysterious documentary sequences. The acoustic elements (bottles and glasses)
  are heavily processed to create an otherworldly, tension-filled soundscape.

πŸ’» Usage

Load the Dataset

python
from datasets import load_dataset

# Load the full dataset
dataset = load_dataset("parquet", data_files="train.parquet")

# Access an example
example = dataset["train"][0]
print("Title:", example["title"])
print("Description:", example["description"])
print("Tags:", example["tags"])

# Access audio
audio_array = example["audio"]["array"]
sample_rate = example["audio"]["sampling_rate"]

Use Descriptions for Music Generation

python
from audiocraft.models import MusicGen

# Use full descriptions to generate similar music
model = MusicGen.get_pretrained('melody')

# Take a description from the dataset
description = dataset["train"][0]["description"]
wav = model.generate([description])

Train Audio Captioning Model

python
# Use this dataset to train models that generate descriptions from audio

for example in dataset["train"]:
    audio = example["audio"]["array"]
    description = example["description"]  # Ground truth description
    tags = example["tags"]  # Alternative: use tags

    # Train your model here

Semantic Music Search

python
from sentence_transformers import SentenceTransformer
from sklearn.metrics.pairwise import cosine_similarity

# Encode all descriptions
model = SentenceTransformer('all-MiniLM-L6-v2')
descriptions = [ex["description"] for ex in dataset["train"]]
embeddings = model.encode(descriptions)

# Search with natural language
query = "dark cinematic orchestral music with tension and drama"
query_emb = model.encode([query])
similarities = cosine_similarity(query_emb, embeddings)

# Get top matches
top_idx = similarities[0].argsort()[-5:][::-1]
for idx in top_idx:
    print(f"{dataset['train'][idx]['title']} by {dataset['train'][idx]['artist']}")

πŸ“ˆ Dataset Statistics

  • β€”Total Tracks: 594
  • β€”Unique Artists: 44
  • β€”Total Tags: 5,962 tag instances
  • β€”Unique Tags: 275
  • β€”Average Tags per Track: ~9.3
  • β€”Average Description Length: ~500 characters
  • β€”Total Duration: ~20 hours

Top Tags

  1. 1.dark (412 tracks)
  2. 2.cinematic (363 tracks)
  3. 3.tense (292 tracks)
  4. 4.ambient (268 tracks)
  5. 5.suspenseful (258 tracks)

πŸ”¬ Description Generation

The full descriptions were generated using NVIDIA's Music Flamingo model, which provides:

  • β€”Mood analysis: Emotional characteristics and atmosphere
  • β€”Energy assessment: Tempo, intensity, and pacing
  • β€”Instrumentation: Detailed breakdown of instruments and sounds
  • β€”Production style: Mixing, effects, and sonic characteristics
  • β€”Use case suggestions: Potential applications for the music

πŸ“œ License & Attribution

This dataset contains music from the Free Music Archive, licensed under Creative Commons Attribution 4.0 International (CC BY 4.0).

Attribution Required

When using this dataset:

  1. 1.Provide attribution to original artists (in attribution field)
  2. 2.Link back to Free Music Archive
  3. 3.Credit NVIDIA Music Flamingo for descriptions
  4. 4.Indicate any modifications made

πŸ™ Acknowledgments

  • β€”[Free Music Archive](https://freemusicarchive.org/): High-quality, openly licensed music
  • β€”Artists: All 44 artists who contributed their music
  • β€”[NVIDIA Music Flamingo](https://huggingface.co/nvidia/music-flamingo-2601-hf): State-of-the-art music understanding model
  • β€”Dataset Creator: Dataset curation and processing

πŸ“ Citation

bibtex
@dataset{fma_music_flamingo_2026,
  title={Free Music Archive with Full Music Flamingo Descriptions},
  author={Free Music Archive and NVIDIA},
  year={2026},
  publisher={Hugging Face},
  howpublished={\url{https://huggingface.co/datasets/atoof/fma-music-descriptions}}
}

Please also cite Music Flamingo:

bibtex
@misc{music-flamingo-2601,
  title={Music Flamingo: A Large-Scale Music Understanding Model},
  author={NVIDIA},
  year={2026},
  howpublished={\url{https://huggingface.co/nvidia/music-flamingo-2601-hf}}
}

πŸ”— Links


Perfect for: Audio captioning research, music generation training, semantic music understanding, audio-to-text models