Math Reasoning on AMC (avg@8 accuracy)
47.29Avg@8 AccuracyJURY-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 47.29 | |
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 46.54 | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 44.28 | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 41.11 | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 40.81 | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 40.51 | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 40.51 | |
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 38.7 | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 35.69 | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 34.19 | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 33.89 | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 33.13 | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 31.17 | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 30.87 | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 29.82 | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 27.41 | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 26.05 | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 24.55 | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 22.89 | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 22.44 | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 21.69 | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 20.93 | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 20.78 | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 19.58 | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 17.62 | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 17.47 | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 17.17 |