Logical Reasoning Reliability Evaluation on LGMT
20.84MVRClaude 4.5 Sonnet
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude 4.5 SonnetZero-shot CoT=true2026.05 | 20.84 | 644 | |
| o4-miniZero-shot CoT=true2026.05 | 22.06 | 682 | |
| DeepSeek ChatZero-shot CoT=true2026.05 | 24.72 | 764 | |
| Llama 3.3Zero-shot CoT=true2026.05 | 25.43 | 786 | |
| GPT-5.2Zero-shot CoT=true2026.05 | 26.76 | 827 | |
| DeepSeek ReasonerZero-shot CoT=true2026.05 | 29.44 | 910 |