AA-LCR
Progress Over Time
Interactive timeline showing model performance evolution on AA-LCR
State-of-the-art frontier
Open
Proprietary
AA-LCR Leaderboard
21 models
| Context | Cost | License | ||||
|---|---|---|---|---|---|---|
| 1 | Meta | 30B | 131K | $0.30 / $1.20 | ||
| 2 | Tencent | 295B | 262K | $0.14 / $0.58 | ||
| 3 | Mistral AI | 119B | 256K | $0.15 / $0.60 | ||
| 4 | Upstage | — | 524K | $0.30 / $1.20 | ||
| 5 | Moonshot AI | 1.0T | — | — | ||
| 6 | Alibaba Cloud / Qwen Team | 1.0T | 256K | $1.20 / $6.00 | ||
| 6 | Alibaba Cloud / Qwen Team | 397B | 262K | $0.45 / $3.00 | ||
| 8 | Alibaba Cloud / Qwen Team | — | 1.0M | $0.50 / $3.00 | ||
| 9 | Alibaba Cloud / Qwen Team | 122B | 262K | $0.29 / $2.40 | ||
| 10 | Alibaba Cloud / Qwen Team | 27B | 262K | $0.26 / $2.60 | ||
| 11 | 550B | 262K | $0.50 / $2.20 | |||
| 12 | InclusionAI | 124B | 131K | $0.06 / $0.18 | ||
| 13 | Alibaba Cloud / Qwen Team | 9B | 262K | $0.10 / $0.15 | ||
| 14 | MiniMax | 230B | 1.0M | $0.30 / $1.20 | ||
| 15 | Alibaba Cloud / Qwen Team | 35B | 262K | $0.14 / $1.00 | ||
| 16 | 120B | 262K | $0.09 / $0.40 | |||
| 17 | Alibaba Cloud / Qwen Team | 4B | — | — | ||
| 18 | 30B | 262K | $0.08 / $0.20 | |||
| 19 | LG AI Research | 33B | — | — | ||
| 20 | Alibaba Cloud / Qwen Team | 2B | — | — | ||
| 21 | Alibaba Cloud / Qwen Team | 800M | — | — |
Notice missing or incorrect data?
What is AA-LCR?
Agent Arena Long Context Reasoning benchmark
AA-LCR is a text benchmark evaluating models on long context and reasoning tasks. LLM Stats tracks 21 models on this benchmark, scored on a 0–1 scale. The current average is 0.6, with the leader at 0.8.
Compare leaders on the best AI for long context and best AI for reasoning leaderboards.
Current leaders
Muse Glimmer-30B from Meta currently leads the AA-LCR leaderboard with a score of 0.800 across 21 evaluated AI models.
FAQ
Common questions about the AA-LCR benchmark and leaderboard.