MultimodalEst. 2023

MMMU

MMMU (Massive Multi-discipline Multimodal Understanding) is a comprehensive benchmark designed to evaluate multimodal models on college-level tasks requiring both visual understanding and domain-specific knowledge. It spans 30 subjects across art, business, science, health, humanities, and engineering with 11,500 questions that include images, diagrams, charts, and tables. Models must jointly reason over visual and textual information.

Metrics

Accuracy (%) across 30 multimodal subjects

Created By

Xiang Yue et al. (IN.AI Research)

Top Model Scores

RankModelScoreDate
1GPT-5.274.8%2026-03
2Gemini 3 Ultra73.5%2026-01
3Claude Opus 4.672.1%2026-02
4Grok 468.7%2026-02
5Llama 4 405B64.3%2026-01