Logical Reasoning on LGMT Logical Reasoning (Evaluation Set)
73.53Static AccuracyClaude 4.5 Sonnet
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Claude 4.5 Sonnet2026.05 | 73.53 | 60.97 | 12.56 | |
| GPT-5.22026.05 | 73.34 | 56.84 | 16.5 | |
| DeepSeek Reasoner2026.05 | 72.44 | 56.71 | 15.72 | |
| DeepSeek Chat2026.05 | 69.91 | 55.65 | 14.27 | |
| o4-mini2026.05 | 69.36 | 56.2 | 13.17 | |
| Llama 3.32026.05 | 65.38 | 52.38 | 13.01 |