Code Generation on LiveCodeBench (avg@5 accuracy)
18.37Avg@5 AccuracyMajority-Voting
Evaluation Results
| Method | Links | |
|---|---|---|
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 18.37 | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 15.68 | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 14.84 | |
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 14.69 | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 14.54 | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 14.33 | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 14.29 | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 14.27 | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 14.05 | |
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 12.78 | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 12.64 | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 11.87 | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 10.58 | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 10.37 | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 10.37 | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 8.11 | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 8.09 | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 7.55 | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 7.05 | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 6.16 | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 5.57 | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 5.57 | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 5.38 | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 4.59 | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 4.57 | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 3.96 | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 3 |