ReasoningEst. 2023

MuSR

MuSR (Multi-Step Reasoning) tests language models on complex problems that require chaining multiple reasoning steps together. The benchmark includes murder mystery puzzles, team allocation problems, and object placement tasks that demand tracking multiple entities, applying logical rules, and maintaining consistency across 5-10 reasoning steps. It exposes weaknesses in models that appear strong on simpler benchmarks.

Metrics

Accuracy (%) on multi-step reasoning tasks

Created By

Zayne Sprague et al.

Top Model Scores

RankModelScoreDate
1GPT-5.271.2%2026-03
2Claude Opus 4.669.8%2026-02
3Gemini 3 Ultra67.4%2026-01
4Grok 463.1%2026-02
5DeepSeek-V460.5%2026-01