Aggregate Reasoning Evaluation on Multi-dataset Reasoning Suite
82.46Average AccuracyHCP-MAD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HCP-MADBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 82.46 | 2,137 | |
| DOWNBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 80.09 | 2,638 | |
| Heter-MADBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 79.66 | 3,168 | |
| MADBase Model=Qwen2.5-32b-instruct2026.04 | 78.98 | 6,111 | |
| SCBase Model=Qwen2.5-32b-instruct2026.04 | 78.11 | 1,376 | |
| MADBase Model=Llama-3.1-70b-instruct2026.04 | 77.74 | 7,413 | |
| MARSBase Model=Qwen2.5-32b-instruct + Llama-3.1-70b-instruct2026.04 | 77.55 | 3,352 | |
| SCBase Model=Llama-3.1-70b-instruct2026.04 | 77.1 | 1,792 | |
| SRBase Model=Qwen2.5-32b-instruct2026.04 | 76.75 | 1,034 | |
| CoTBase Model=Llama-3.1-70b-instruct2026.04 | 76.48 | 580 | |
| SRBase Model=Llama-3.1-70b-instruct2026.04 | 75.64 | 1,339 | |
| CoTBase Model=Qwen2.5-32b-instruct2026.04 | 75.08 | 483 |