Reasoning on Benchmark A BBH and paradoxes 1.0 (test)
94.7AccuracyGPT-5.2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5.2Setting=CQD2026.01 | 94.7 | 1.9 | 0.18 | |
| Gemini 2.0 FlashSetting=CQD2026.01 | 92.8 | 2.2 | 0.21 | |
| Claude 3.7 SonnetSetting=baseline CoT2026.01 | 91.5 | 2.8 | 1 | |
| GPT-4oSetting=baseline CoT2026.01 | 72.4 | 8.4 | 1 |