CoolFace
Datasetpublic

anvo25/vmmu

ViExam: Are Vision Language Models Better than Humans on Vietnamese Multimodal Exam Questions? by Vy Tuong Dang*, An Vo*, Quang Tau, Duc Dm, Daeyoung Kim, *Equal contribution  KAIST TLDR: State-of-the-art Vision Language Models (VLMs) demonstrate remarkable capabilities on English multimodal tasks but significantly underperform on Vietnamese educational assessments. ViExam reveals that SOTA VLMs achieve only 57.74%… See the full description on the dataset page: https://huggingface.co/datasets/anvo25/vmmu.

sourceHugging Facemitupdated 1y agoView on Hugging Face
2likes126downloads
14 commits on main
cff94ae1y ago

Update README.md

anvo25
11e807c1y ago

Update README.md

anvo25
39f6a7d1y ago

Improve ViExam dataset card: correct GitHub link, add badges and citation (#3)

anvo25, nielsr
45417ec1y ago

Update README.md

anvo25
56345221y ago

Improve dataset card: Add task category, language, tags, and full abstract (#2)

anvo25, nielsr
c92fbd71y ago

Update README.md

anvo25
9d14c351y ago

Update README.md

anvo25
83e1bd31y ago

Update README.md

anvo25
77d1fda1y ago

Update README.md

anvo25
c8bddc61y ago

Upload dataset

anvo25
e4d32fd1y ago

Upload dataset

anvo25
0cd77351y ago

Upload dataset

anvo25
9c9aaaf1y ago

Upload dataset

anvo25
5ed351c1y ago

initial commit

anvo25