PolyMATH
Progress Over Time
Interactive timeline showing model performance evolution on PolyMATH
PolyMATH Leaderboard
| Context | Cost | License | ||||
|---|---|---|---|---|---|---|
| 1 | Alibaba Cloud / Qwen Team | — | 1.0M | $1.25 / $3.75 | ||
| 2 | Alibaba Cloud / Qwen Team | — | — | — | ||
| 3 | Alibaba Cloud / Qwen Team | — | 1.0M | $0.50 / $3.00 | ||
| 4 | Alibaba Cloud / Qwen Team | 397B | — | — | ||
| 5 | Alibaba Cloud / Qwen Team | 27B | 262K | $0.30 / $2.40 | ||
| 6 | Alibaba Cloud / Qwen Team | 122B | — | — | ||
| 7 | Alibaba Cloud / Qwen Team | 35B | — | — | ||
| 8 | Alibaba Cloud / Qwen Team | 235B | — | — | ||
| 9 | Alibaba Cloud / Qwen Team | 9B | — | — | ||
| 10 | Alibaba Cloud / Qwen Team | 80B | — | — | ||
| 11 | Alibaba Cloud / Qwen Team | 33B | — | — | ||
| 12 | Alibaba Cloud / Qwen Team | 31B | — | — | ||
| 13 | Alibaba Cloud / Qwen Team | 4B | — | — | ||
| 14 | Alibaba Cloud / Qwen Team | 235B | — | — | ||
| 15 | Alibaba Cloud / Qwen Team | 9B | — | — | ||
| 16 | Alibaba Cloud / Qwen Team | 80B | — | — | ||
| 17 | Alibaba Cloud / Qwen Team | 4B | 262K | $0.10 / $1.00 | ||
| 18 | Alibaba Cloud / Qwen Team | 31B | — | — | ||
| 19 | Alibaba Cloud / Qwen Team | 33B | — | — | ||
| 20 | Alibaba Cloud / Qwen Team | 9B | — | — | ||
| 21 | Alibaba Cloud / Qwen Team | 4B | 262K | $0.10 / $0.60 | ||
| 22 | Alibaba Cloud / Qwen Team | 2B | — | — | ||
| 23 | Alibaba Cloud / Qwen Team | 800M | — | — |
What is PolyMATH?
Polymath is a challenging multi-modal mathematical reasoning benchmark designed to evaluate the general cognitive reasoning abilities of Multi-modal Large Language Models (MLLMs). The benchmark comprises 5,000 manually collected high-quality images of cognitive textual and visual challenges across 10 distinct categories, including pattern recognition, spatial reasoning, and relative reasoning.
PolyMATH is a multimodal benchmark evaluating models on math, multimodal, reasoning, spatial reasoning, and vision tasks. LLM Stats tracks 23 models on this benchmark, scored on a 0–1 scale. The current average is 0.5, with the leader at 0.9.
Compare leaders on the best AI for math, best AI for multimodal, best AI for reasoning, best AI for spatial reasoning and best AI for vision leaderboards.
Current leaders
Qwen3.7 Max from Alibaba Cloud / Qwen Team currently leads the PolyMATH leaderboard with a score of 0.865 across 23 evaluated AI models.
FAQ
Common questions about the PolyMATH benchmark and leaderboard.