General Reasoning Average on Aggregate (OBQA, CSQA, SIQA, ARC, MMLU, GSM8K-MC, AQUA)
86.21Average AccuracyIoT
Evaluation Results
| Method | Links | |
|---|---|---|
| IoTModel=GPT-4o mini2026.03 | 86.21 | |
| CoTModel=GPT-4o mini2026.03 | 85.23 | |
| IoTModel=Olmo-2-13B2026.03 | 80.69 | |
| SCModel=Olmo-2-13B2026.03 | 80.04 | |
| CoTModel=Olmo-2-13B2026.03 | 78.75 | |
| IoTModel=Olmo-2-7B2026.03 | 77.35 | |
| EoTModel=Olmo-2-13B2026.03 | 76.13 | |
| CoTModel=Olmo-2-7B2026.03 | 75.38 | |
| IoTModel=Llama-3.3-8B2026.03 | 75.22 | |
| SCModel=Llama-3.3-8B2026.03 | 74.89 | |
| SCModel=Olmo-2-7B2026.03 | 74.81 | |
| EoTModel=Llama-3.3-8B2026.03 | 72.38 | |
| CoTModel=Llama-3.3-8B2026.03 | 72.28 | |
| EoTModel=Olmo-2-7B2026.03 | 71.93 |