Tactical chess puzzles with a single forced best move, presented as text positions.
Precise state tracking and lookahead in a domain where a plausible-looking answer is usually wrong.
Tests board-state tracking more than chess strength as such.
| # | Model | Lab | Score | Measured | Method | Source |
|---|---|---|---|---|---|---|
| 1 | GPT-5.5 Pro | OpenAI | 64.0% | 2026-05-01 | independent | Epoch AI Benchmarking Hub |
| 2 | GPT-5.4 Pro | OpenAI | 58.6% | 2026-03-19 | independent | Epoch AI Benchmarking Hub |
| 3 | Gemini 3.1 Pro | Google DeepMind | 52.0% | 2026-08-06 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 4 | Gemini 3.7 Flash | Google DeepMind | 47.0% | 2026-08-14 | independent | Epoch AI Benchmarking Hub |
| 5 | Gemini 3.5 Flash | Google DeepMind | 46.0% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 6 | Gemini 3.6 Flash | Google DeepMind | 39.3% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 7 | Gemini 3 Flash | Google DeepMind | 39.0% | 2026-08-06 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 8 | GPT-5.6 Sol | OpenAI | 38.3% | 2026-08-07 | independent · 4 runs | Epoch AI Benchmarking Hub |
| 9 | Claude Fable 5 | Anthropic | 36.7% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 10 | Grok 4.5 | xAI | 36.0% | 2026-07-08 | independent | Epoch AI Benchmarking Hub |
| 11 | Grok 4.6 | xAI | 35.5% | 2026-08-14 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 12 | DeepSeek V4 Flash 0731open | DeepSeek | 33.0% | 2026-08-02 | independent | Epoch AI Benchmarking Hub |
| 13 | o3 | OpenAI | 33.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 14 | Claude Opus 5 | Anthropic | 31.7% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 15 | GPT-5.2 | OpenAI | 31.2% | 2026-07-13 | independent · 5 runs | Epoch AI Benchmarking Hub |
| 16 | Gemini 3 Pro | Google DeepMind | 31.0% | 2025-12-08 | independent | Epoch AI Benchmarking Hub |
| 17 | GPT-5.5 | OpenAI | 30.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 18 | GPT-5.4 | OpenAI | 29.0% | 2026-07-15 | independent · 5 runs | Epoch AI Benchmarking Hub |
| 19 | Qwen 3.8 Max | Alibaba | 29.0% | 2026-08-04 | independent | Epoch AI Benchmarking Hub |
| 20 | Grok 4 | xAI | 28.0% | 2026-01-30 | independent | Epoch AI Benchmarking Hub |
| 21 | Kimi K3open | Moonshot AI | 28.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 22 | GPT-5.6 Terra | OpenAI | 27.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 23 | GPT-5 | OpenAI | 26.5% | 2026-07-15 | independent · 4 runs | Epoch AI Benchmarking Hub |
| 24 | Kimi K2.6open | Moonshot AI | 26.0% | 2026-05-07 | independent | Epoch AI Benchmarking Hub |
| 25 | Claude Sonnet 5 | Anthropic | 25.5% | 2026-06-30 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 26 | Claude Opus 4.8 | Anthropic | 25.3% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 27 | Grok 4.3 Beta | xAI | 25.0% | 2026-06-17 | independent | Epoch AI Benchmarking Hub |
| 28 | Grok 4.20 | xAI | 24.0% | 2026-07-13 | independent | Epoch AI Benchmarking Hub |
| 29 | Gemini 3.1 Flash-Lite | Google DeepMind | 23.0% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 30 | Qwen 3.5 Plus (hosted 397B-A17B) | Alibaba | 22.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 31 | GPT-5.1 | OpenAI | 21.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 32 | GPT-5.6 Luna | OpenAI | 21.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 33 | Inklingopen | Thinking Machines | 21.0% | 2026-08-05 | independent | Epoch AI Benchmarking Hub |
| 34 | Kimi K2.7 Codeopen | Moonshot AI | 21.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 35 | Qwen 3.5 Flash (hosted 35B-A3B) | Alibaba | 21.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 36 | Gemini 3.5 Flash-Lite | Google DeepMind | 20.3% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 37 | Gemini 2.5 Pro (Jun 2025) | Google DeepMind | 20.0% | 2025-12-08 | independent | Epoch AI Benchmarking Hub |
| 38 | gpt-oss-120bopen | OpenAI | 20.0% | 2025-12-11 | independent | Epoch AI Benchmarking Hub |
| 39 | Kimi K2 Thinkingopen | Moonshot AI | 20.0% | 2025-12-10 | independent | Epoch AI Benchmarking Hub |
| 40 | o4-mini | OpenAI | 20.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 41 | Qwen 3.6 Flash | Alibaba | 20.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 42 | Qwen 3.6 Max (Preview) | Alibaba | 20.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 43 | Claude Opus 4.7 | Anthropic | 19.0% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 44 | GLM-5.1open | Z.ai | 19.0% | 2026-08-10 | independent | Epoch AI Benchmarking Hub |
| 45 | Qwen3.7-Max | Alibaba | 19.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 46 | Inkling-Smallopen | Thinking Machines | 18.0% | 2026-08-14 | independent | Epoch AI Benchmarking Hub |
| 47 | Qwen 3.6 Plus | Alibaba | 17.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 48 | GPT-5.4 Nano | OpenAI | 16.7% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 49 | Qwen3.7-Plus | Alibaba | 16.5% | 2026-08-07 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 50 | GPT-5 mini | OpenAI | 16.3% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 51 | Qwen3.7 Flash | Alibaba | 16.0% | 2026-08-07 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 52 | Qwen3.6 27Bopen | Alibaba | 15.5% | 2026-08-07 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 53 | GPT-5.4 Mini | OpenAI | 15.0% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 54 | Qwen 3.6 35B-A3Bopen | Alibaba | 15.0% | 2026-08-07 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 55 | GPT-5 nano | OpenAI | 14.3% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 56 | MiniMax-M3open | MiniMax | 14.0% | 2026-08-10 | independent | Epoch AI Benchmarking Hub |
| 57 | Claude Opus 4.6 | Anthropic | 13.5% | 2026-08-06 | independent · 4 runs | Epoch AI Benchmarking Hub |
| 58 | GLM-5.2open | Z.ai | 13.5% | 2026-08-10 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 59 | DeepSeek-V4-Proopen | DeepSeek | 13.3% | 2026-08-06 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 60 | GPT-4o | OpenAI | 13.0% | 2026-07-15 | independent | Epoch AI Benchmarking Hub |
| 61 | Qwen3.5 397B-A17Bopen | Alibaba | 12.5% | 2026-08-07 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 62 | GPT-5.5 Instant | OpenAI | 12.0% | 2026-08-02 | independent | Epoch AI Benchmarking Hub |
| 63 | Kimi K2.5open | Moonshot AI | 12.0% | 2026-01-28 | independent | Epoch AI Benchmarking Hub |
| 64 | Qwen3-235B-A22B (Jul 2025)open | Alibaba | 12.0% | 2025-12-11 | independent | Epoch AI Benchmarking Hub |
| 65 | o1 | OpenAI | 11.3% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 66 | o3-mini | OpenAI | 10.7% | 2026-08-07 | independent · 3 runs | Epoch AI Benchmarking Hub |
| 67 | GLM-5open | Z.ai | 10.0% | 2026-02-12 | independent | Epoch AI Benchmarking Hub |
| 68 | Claude Haiku 4.5 | Anthropic | 8.0% | 2026-07-16 | independent | Epoch AI Benchmarking Hub |
| 69 | Claude Opus 4.5 | Anthropic | 8.0% | 2026-08-06 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 70 | Claude Sonnet 4.5 | Anthropic | 8.0% | 2026-08-06 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 71 | DeepSeek-V3.2open | DeepSeek | 7.5% | 2026-07-16 | independent · 2 runs | Epoch AI Benchmarking Hub |
| 72 | Claude Sonnet 4.6 | Anthropic | 7.3% | 2026-08-06 | independent · 4 runs | Epoch AI Benchmarking Hub |
| 73 | Claude Opus 4.1 | Anthropic | 7.0% | 2026-07-20 | independent | Epoch AI Benchmarking Hub |
| 74 | GPT-4.1 mini | OpenAI | 7.0% | 2026-07-15 | independent | Epoch AI Benchmarking Hub |
| 75 | GLM-4.7open | Z.ai | 6.0% | 2026-01-29 | independent | Epoch AI Benchmarking Hub |
| 76 | GPT-4 Turbo (Apr 2024) | OpenAI | 6.0% | 2026-07-15 | independent | Epoch AI Benchmarking Hub |
| 77 | GPT-4.1 | OpenAI | 6.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 78 | Claude 3 Opus | Anthropic | 5.0% | 2026-07-15 | independent | Epoch AI Benchmarking Hub |
| 79 | Gemma 4 31B ITopen | Google DeepMind | 5.0% | 2026-08-06 | independent | Epoch AI Benchmarking Hub |
| 80 | GPT-4 (Jun 2023) | OpenAI | 4.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 81 | Qwen3-Max | Alibaba | 4.0% | 2025-12-10 | independent | Epoch AI Benchmarking Hub |
| 82 | Gemma 3 27Bopen | Google DeepMind | 0.0% | 2026-08-06 | independent | Epoch AI Benchmarking Hub |
| 83 | GPT-3.5 Turbo | OpenAI | 0.0% | 2026-08-07 | independent | Epoch AI Benchmarking Hub |
| 84 | GPT-4o mini | OpenAI | 0.0% | 2026-07-15 | independent | Epoch AI Benchmarking Hub |