lilvjosephtang/SEAM-Benchmark
SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models CSSLab, Department of Computer Science, University of Toronto[COLM '25] Second Conference on Language Modeling Paper: Paper Project Page / Leaderboard: SEAM Benchmark Code: GitHub Abstract Evaluating whether vision-language models (VLMs) reason consistently across representations is challenging because modality comparisons are typically confounded by task differences and… See the full description on the dataset page: https://huggingface.co/datasets/lilvjosephtang/SEAM-Benchmark.
Update dataset card: License, task category, paper link, and abstract (#2)
Update README.md
Add dataset card
Upload SEAM benchmark with 16 task-based splits
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Add dataset card
Upload SEAM benchmark with 16 task-based splits
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Add dataset card
Upload SEAM benchmark with 16 task-based splits
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
Clean up old dataset files
