Logical Reasoning on PC-83K 1.0 (test)
91.1Normal ScoreChatGPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ChatGPT-5Category=Proprietary Models2025.08 | 91.1 | 86.3 | 88.7 | |
| DeepSeek-R1-0528Series=DeepSeek Series2025.08 | 88.7 | 82.6 | 85.6 | |
| Seed1.6Category=Proprietary Models2025.08 | 87.8 | 82.4 | 85.1 | |
| ChatGPT-o3Category=Proprietary Models2025.08 | 87.1 | 83.4 | 85.3 | |
| Gemini-3-proCategory=Proprietary Models2025.08 | 86.5 | 83 | 84.8 | |
| Qwen3-235B-A22BSeries=Qwen3 Series2025.08 | 82.9 | 73.8 | 78.3 | |
| Qwen3-14BSeries=Qwen3 Series2025.08 | 78.6 | 67 | 72.8 | |
| Qwen3-32BSeries=Qwen3 Series2025.08 | 77 | 68.1 | 72.5 | |
| DeepSeek-R1-0528-Qwen3-8BSeries=DeepSeek Series2025.08 | 76 | 66.8 | 71.4 | |
| Gemini-2.5-proCategory=Proprietary Models2025.08 | 75.8 | 67.2 | 71.5 | |
| Qwen3-8BSeries=Qwen3 Series2025.08 | 71.6 | 59.4 | 65.5 | |
| GLM-Z1-32B-0414Series=GLM Series2025.08 | 71.1 | 60.9 | 66 | |
| GLM-Z1-9B-0414Series=GLM Series2025.08 | 63.6 | 53.5 | 58.6 | |
| Claude-4-sonnetCategory=Proprietary Models2025.08 | 62.7 | 47.8 | 55.3 | |
| DeepSeek-R1-Distill-Qwen-32BSeries=DeepSeek Series2025.08 | 53.3 | 43.2 | 48.3 | |
| DeepSeek-R1-Distill-Qwen-14BSeries=DeepSeek Series2025.08 | 47.9 | 38.4 | 43.1 | |
| Gemini-2.0-flashCategory=Proprietary Models2025.08 | 42 | 31.6 | 36.8 | |
| Claude-3.5-sonnetCategory=Proprietary Models2025.08 | 37.6 | 27.4 | 32.5 | |
| Qwen2.5-72B-InstructSeries=Qwen2.5 Series2025.08 | 32.8 | 25.3 | 29 | |
| ChatGPT-4oCategory=Proprietary Models2025.08 | 31.7 | 24.6 | 28.2 | |
| Qwen2.5-32B-InstructSeries=Qwen2.5 Series2025.08 | 31.4 | 23.5 | 27.4 | |
| Qwen2.5-14B-InstructSeries=Qwen2.5 Series2025.08 | 24.3 | 17.9 | 21.1 | |
| Qwen2.5-7B-InstructSeries=Qwen2.5 Series2025.08 | 16.8 | 12.1 | 14.5 |