Math Reasoning on GSM8K (pass@4)
95.83Pass@4 AccuracyJURY-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 95.83 | 64.04 | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 95.75 | 63.54 | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 95.6 | 59.99 | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 95.38 | 53.99 | |
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 95.22 | 62.48 | |
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 95 | 61.52 | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 93.86 | 60.33 | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 93.78 | 56.77 | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 93.78 | 62.62 | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 93.25 | 53.51 | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 92.42 | 55.36 | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 92.42 | 59.41 | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 92.34 | 52.51 | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 92.04 | 53.4 | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 91.74 | 50.35 | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 90.98 | 42.2 | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 90.96 | — | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 90.83 | 55.17 | |
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 90.83 | — | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 90.75 | 54.86 | |
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 90.52 | — | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 90.45 | 43.51 | |
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 90.35 | — | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 90.16 | — | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 90.14 | 45.46 | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 90.07 | 48.48 | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 89.99 | 46.21 | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 89.84 | 45.93 | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 89.73 | — | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 89.31 | 49.59 | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 88.21 | — | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 87.85 | — | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 86.88 | 46.26 | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 84.69 | 42.12 | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 84.46 | 42.77 | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 82.58 | — | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 82.01 | — | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 81.97 | — | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 81.84 | — | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 81.08 | — | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 81.07 | — | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 80 | — | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 79.72 | — | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 79.45 | — | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 78.96 | — | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 78.64 | — | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 78.6 | — | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 78.51 | — | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 73.71 | — | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 73.52 | — | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 71 | — | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 68.78 | — | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 68.57 | — | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 64.2 | — |