RealWorldQA
Progress Over Time
Interactive timeline showing model performance evolution on RealWorldQA
RealWorldQA Leaderboard
| Context | Cost | License | ||||
|---|---|---|---|---|---|---|
| 1 | Alibaba Cloud / Qwen Team | 125B | 1.0M | $0.15 / $0.47 | ||
| 1 | Alibaba Cloud / Qwen Team | 125B | — | — | ||
| 3 | Alibaba Cloud / Qwen Team | 2.4T | 1.0M | $1.65 / $4.95 | ||
| 4 | Alibaba Cloud / Qwen Team | — | — | — | ||
| 5 | ByteDance | — | — | — | ||
| 6 | ByteDance | — | — | — | ||
| 7 | Alibaba Cloud / Qwen Team | 28B | 262K | — | ||
| 8 | Alibaba Cloud / Qwen Team | — | 1.0M | $0.50 / $3.00 | ||
| 9 | Alibaba Cloud / Qwen Team | 35B | — | — | ||
| 10 | Alibaba Cloud / Qwen Team | 122B | — | — | ||
| 11 | Alibaba Cloud / Qwen Team | 28B | 262K | $0.60 / $3.60 | ||
| 11 | Alibaba Cloud / Qwen Team | 35B | — | — | ||
| 13 | Alibaba Cloud / Qwen Team | 27B | 262K | $0.30 / $2.40 | ||
| 14 | Alibaba Cloud / Qwen Team | 236B | — | — | ||
| 15 | Alibaba Cloud / Qwen Team | 236B | — | — | ||
| 16 | Alibaba Cloud / Qwen Team | 33B | — | — | ||
| 17 | Alibaba Cloud / Qwen Team | 33B | — | — | ||
| 18 | Alibaba Cloud / Qwen Team | 73B | — | — | ||
| 19 | Alibaba Cloud / Qwen Team | 31B | — | — | ||
| 20 | Alibaba Cloud / Qwen Team | 31B | — | — | ||
| 21 | Alibaba Cloud / Qwen Team | 9B | — | — | ||
| 22 | Alibaba Cloud / Qwen Team | 4B | 262K | $0.10 / $1.00 | ||
| 23 | Liquid AI | 3B | — | — | ||
| 24 | Alibaba Cloud / Qwen Team | 9B | — | — | ||
| 25 | Alibaba Cloud / Qwen Team | 4B | 262K | $0.10 / $0.60 | ||
| 26 | Alibaba Cloud / Qwen Team | 7B | — | — | ||
| 27 | xAI | — | — | — | ||
| 28 | DeepSeek | 27B | — | — | ||
| 29 | DeepSeek | 16B | — | — | ||
| 30 | DeepSeek | 3B | — | — | ||
| 31 | 2B | — | — |
What is RealWorldQA?
RealWorldQA is a benchmark designed to evaluate basic real-world spatial understanding capabilities of multimodal models. The initial release consists of over 700 anonymized images taken from vehicles and other real-world scenarios, each accompanied by a question and easily verifiable answer. Released by xAI as part of their Grok-1.5 Vision preview to test models' ability to understand natural scenes and spatial relationships in everyday visual contexts.
RealWorldQA is a multimodal benchmark evaluating models on spatial reasoning and vision tasks. LLM Stats tracks 31 models on this benchmark, scored on a 0–1 scale. The current average is 0.8, with the leader at 0.9.
Compare leaders on the best AI for spatial reasoning and best AI for vision leaderboards.
Current leaders
Qwen3.8 Flash from Alibaba Cloud / Qwen Team currently leads the RealWorldQA leaderboard with a score of 0.885 across 31 evaluated AI models.
FAQ
Common questions about the RealWorldQA benchmark and leaderboard.