Commonsense Question Answering on OBQA
93.4AccuracyIoT
Evaluation Results
| Method | Links | |
|---|---|---|
| IoTModel=GPT-4o mini2026.03 | 93.4 | |
| CoTModel=GPT-4o mini2026.03 | 88.8 | |
| IoTModel=Olmo-2-13B2026.03 | 87.6 | |
| CoTModel=Olmo-2-13B2026.03 | 85.4 | |
| IoTModel=Olmo-2-7B2026.03 | 84.2 | |
| EoTModel=Olmo-2-13B2026.03 | 83.4 | |
| SCModel=Olmo-2-13B2026.03 | 82 | |
| CoTModel=Olmo-2-7B2026.03 | 80.8 | |
| IoTModel=Llama-3.3-8B2026.03 | 78.4 | |
| SCModel=Llama-3.3-8B2026.03 | 77.8 | |
| SCModel=Olmo-2-7B2026.03 | 75.8 | |
| EoTModel=Llama-3.3-8B2026.03 | 75.8 | |
| EoTModel=Olmo-2-7B2026.03 | 74.6 | |
| CoTModel=Llama-3.3-8B2026.03 | 74.6 | |
| SUBFITModel=Qwen2.5-7B-Instruct, Sparsity=25%2026.06 | 40.2 | |
| SUBFITModel=Llama-3.1-8B-Instruct, Sparsity=25%2026.06 | 39.2 | |
| SUBFITModel=Llama-3.2-3B-Instruct, Sparsity=25%2026.06 | 34.2 | |
| SUBFITModel=DeepSeek-7B-chat, Sparsity=25%2026.06 | 34 | |
| SUBFITModel=Qwen3-4B-Instruct, Sparsity=25%2026.06 | 33.2 |