Math Reasoning on GSM-Hard (test)
55.94AccuracyCriSPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CriSPOWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 55.94 | |
| aPSFWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 55.86 | |
| ProTeGiWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 55.59 | |
| aPSFWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 54.77 | |
| APEWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 54.55 | |
| ProTeGiWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 53.88 | |
| Zero-shot CoTWorker Model=Qwen2.5-7B-Instruct, Optimization Protocol=No optimization (p_init)2026.04 | 53.79 | |
| OPROWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 53.6 | |
| GrIPSWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 53.41 | |
| ZERAWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 53.22 | |
| ZERAWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 52.63 | |
| GrIPSWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 52.56 | |
| APEWorker Model=Qwen2.5-7B-Instruct, Architect Model=Qwen3-8B2026.04 | 51.7 | |
| OPROWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 51.69 | |
| CriSPOWorker Model=Qwen2.5-7B-Instruct, Architect Model=gpt-oss-120b2026.04 | 51.25 | |
| aPSFWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 42.96 | |
| aPSFWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 35.98 | |
| ProTeGiWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 35.88 | |
| CriSPOWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 35.16 | |
| CriSPOWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 34.94 | |
| ZERAWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 34.7 | |
| ZERAWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 34.58 | |
| OPROWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 34.47 | |
| OPROWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 33.62 | |
| Zero-shot CoTWorker Model=Llama-3.1-8B-Instruct, Optimization Protocol=No optimization (p_init)2026.04 | 33.6 | |
| ProTeGiWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 33.52 | |
| APEWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 33.05 | |
| GrIPSWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 32.95 | |
| GrIPSWorker Model=Llama-3.1-8B-Instruct, Architect Model=Qwen3-8B2026.04 | 32.86 | |
| APEWorker Model=Llama-3.1-8B-Instruct, Architect Model=gpt-oss-120b2026.04 | 31.07 |