GeneralEst. 2024

LiveBench

LiveBench is a continuously updated benchmark that uses new questions every month, drawn from recent information sources, to prevent data contamination. It covers math, coding, reasoning, language, instruction following, and data analysis. Because questions are regularly refreshed, models cannot have seen the test data during training, providing a cleaner signal of genuine model capability versus memorization.

Metrics

Average score (%) across 6 categories

Created By

Colin White et al. (Abacus.AI)

Top Model Scores

RankModelScoreDate
1GPT-5.278.3%2026-03
2Claude Opus 4.676.9%2026-02
3Gemini 3 Ultra75.1%2026-01
4Grok 472.4%2026-02
5DeepSeek-V470.8%2026-01