CoolFace
Datasetpublic

Vladislavbro-500/music-recommendations

Group aggregators over a frozen scorer — artifacts (YAMBDA-50m) Чекпоинты и промежуточные артефакты для групповых музыкальных рекомендаций: per-user скорер, кэш его топ-200, аудиоэмбеддинги каталога и обученные групповые агрегаторы. Всё производное от yandex/yambda, flavor 50m. Состав Путь Что это gsasrec/best.pt, config.json, metrics.csv SASRec-скорер, 276 305 items, test NDCG@10 = 0.0726 gsasrec/item_id_to_idx.pkl item_id YAMBDA → компактный индекс… See the full description on the dataset page: https://huggingface.co/datasets/Vladislavbro-500/music-recommendations.

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes114downloads
Dataset Card

Group aggregators over a frozen scorer — artifacts (YAMBDA-50m)

Чекпоинты и промежуточные артефакты для групповых музыкальных рекомендаций: per-user скорер, кэш его топ-200, аудиоэмбеддинги каталога и обученные групповые агрегаторы. Всё производное от `yandex/yambda`, flavor 50m.

Состав

ПутьЧто это
gsasrec/best.pt, config.json, metrics.csvSASRec-скорер, 276 305 items, test NDCG@10 = 0.0726
gsasrec/item_id_to_idx.pklitem_id YAMBDA → компактный индекс
user_scores_cache/scores.parquetтоп-200 скоров на пользователя, 9 170 пользователей
audio/embeddings.npyаудиоэмбеддинги YAMBDA, 276 306 × 128, переиндексированные под каталог
audio/user_profiles.npy, uid_to_row.pkl, user_audio_valid.npyаудиопрофили пользователей и маска покрытия
aggregators/{agree,groupim,audio_agree,group_cross_attn}/чекпоинты групповых агрегаторов
aggregators/groups_split.pklсинтетический split групп (10k/2k/2k, размеры 2–5, seed 42)
eval_results/summary.csv, summary_by_size.csv, paired.csv, per_sample.npz, LaTeX-таблица

Результаты (групповой NDCG на test-группах)

МетодNDCG@10NDCG@20
GroupCrossAttn0.09160.1024
Audio-AGREE0.09010.1014
Max Pleasure0.08280.0915
GroupIM0.08110.0912
AGREE0.07900.0901
Average0.06950.0819
Least Misery0.03120.0363

Скорер заморожен, обучаются только параметры агрегатора. Кандидаты берутся из кэша топ-200, поэтому числа сравнимы между методами, но усечены по построению.

Лицензия и атрибуция

Apache 2.0, унаследована от исходного датасета. audio/embeddings.npy — отфильтрованная и переиндексированная копия аудиоэмбеддингов YAMBDA (Copyright 2025 YANDEX LLC). YAMBDA опубликован для научных и исследовательских целей; эти производные распространяются на тех же условиях.

Препринт датасета: https://arxiv.org/abs/2505.22238