datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
WEIRD
WEIRD
Описание задачи
WEIRD – это расширенная версия подзадачи бинарной классификации оригинального английского бенчмарка WHOOPS!. Датасет оценивает, способна ли мультимодальная модель обнаруживать нарушения здравого смысла в изображениях. Здесь нарушение здравого смысла – это ситуации, противоречащие типичным нормам реальности. Например, пингвины не могут летать, дети не водят автомобили, посетители не накладывают еду официантам, и так далее. В датасете поровну… See the full description on the dataset page: https://huggingface.co/datasets/MERA-evaluation/WEIRD.evaluation
Skill-Aligned Annotation for Text-to-Image Evaluation
Companion dataset for the NeurIPS 2026 paper "Towards Objective Evaluation".
The dataset contains generated images from 7 text-to-image models, evaluated
by 6 human annotators (anonymized) plus an LLM judge across 9 skill-aligned
annotation strategies.
Configs
Config
Rows
Description
images
621
Generated images (621 WebP) with embedded bytes; one row per (prompt_id, generator).
prompts
179
Per-prompt… See the full description on the dataset page: https://huggingface.co/datasets/Skill-Aigned/evaluation.
