Reasoning on ARC-1 sampled 15 reasoning task instances Chollet 2019
86.47Task 1 AccuracyGPT-5
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5reasoning efforts level=minimal2025.12 | 86.47 | — | 65.05 | 49.61 | 100 | 89.34 | 100 | 40.27 | 100 | 96.47 | 54.55 | 82 | 94.72 | 43.76 | 32.6 | 71.95 | |
| Ours (ERO+Qwen2.5-7B)Evolutionary Reasoning Optimization=enabled, Base Model=Qwen2.5-7B, Population size lambda=1000, Islands Z=4, Elite pool size mu=4, Optimization budget G=12 generations2025.12 | 77.65 | — | 78.2 | 98.45 | 78.28 | 90.16 | 100 | 81 | 100 | 94.61 | 81.82 | 100 | 96.27 | 71.93 | 73.15 | 70.73 | |
| Qwen2.5-7BEvolutionary Reasoning Optimization=disabled2025.12 | 70.59 | — | 11.32 | 93.8 | 42.53 | 26.23 | 93.44 | 35.84 | 64 | 84.91 | 33.33 | 64 | 93.79 | 64.86 | 53.7 | 60.98 | |
| GPT-4o2025.12 | 61.95 | — | 26.99 | 97.67 | 44.34 | 22.95 | 75.41 | 63.8 | 100 | 88.8 | 60.61 | 64 | 96.89 | 68.61 | 72.05 | 63.41 | |
| Qwen2.5-32B2025.12 | 61.18 | — | 38.31 | 95.35 | 41.43 | 51.64 | 63.93 | 9.24 | 100 | 43.15 | 48.48 | 52 | 47.52 | 72.35 | 62.05 | 42.68 | |
| GPT-4o-mini2025.12 | 14.01 | — | 12 | 93.8 | 38.75 | 31.15 | 93.44 | 31.22 | 64 | 92.12 | 45.45 | 64 | 93.79 | 54.89 | 55.07 | 63.41 |