Math Reasoning on AIME 2024 (avg@16 accuracy)
18.33Accuracy (avg@16)GT-Reward
Evaluation Results
| Method | Links | |
|---|---|---|
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 18.33 | |
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 13.75 | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 12.08 | |
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 11.25 | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 11.25 | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 11.04 | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 10.62 | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 10.42 | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 10.21 | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 9.79 | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 9.38 | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 9.17 | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 8.33 | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 7.71 | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 7.71 | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 6.88 | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 6.88 | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 6.88 | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 6.67 | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 6.67 | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 5.83 | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 4.38 | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 3.54 | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 3.54 | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 3.12 | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 2.71 | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 2.08 |