Multi-task Knowledge on MMLU-Pro
37.42MMLU-Pro ScoreAHD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AHDDecoding Strategy=AHD2026.04 | 37.42 | 133.06 | |
| SaberDecoding Strategy=Saber2026.04 | 36.1 | 123.83 | |
| Fast-dLLMDecoding Strategy=Fast-dLLM2026.04 | 35.7 | 134.76 | |
| KLASSDecoding Strategy=KLASS2026.04 | 35.67 | 187.17 | |
| VanillaDecoding Strategy=Vanilla2026.04 | 35.57 | 256 | |
| PC-samplerDecoding Strategy=PC-sampler2026.04 | 33.9 | 256 | |
| JURY-RLBackbone=Qwen2.5-7B2026.04 | 0.5 | — | |
| LLM-as-a-JudgeBackbone=Qwen2.5-7B2026.04 | 0.4867 | — | |
| GT-RewardBackbone=Qwen2.5-7B2026.04 | 0.4509 | — | |
| Before RLBackbone=Qwen2.5-7B2026.04 | 0.4403 | — | |
| Self-CertaintyBackbone=Qwen2.5-7B2026.04 | 0.4389 | — | |
| Majority-VotingBackbone=Qwen2.5-7B2026.04 | 0.4383 | — | |
| LLM-KDBackbone=Qwen2.5-7B2026.04 | 0.4373 | — | |
| EntropyBackbone=Qwen2.5-7B2026.04 | 0.4261 | — | |
| CoRewardBackbone=Qwen2.5-7B2026.04 | 0.4208 | — | |
| GT-RewardBackbone=Qwen3-1.7B-Base2026.04 | 0.3943 | — | |
| JURY-RLBackbone=Qwen3-1.7B-Base2026.04 | 0.3811 | — | |
| LLM-KDBackbone=Qwen3-1.7B-Base2026.04 | 0.3797 | — | |
| CoRewardBackbone=Qwen3-1.7B-Base2026.04 | 0.3739 | — | |
| EntropyBackbone=Qwen3-1.7B-Base2026.04 | 0.3701 | — | |
| Majority-VotingBackbone=Qwen3-1.7B-Base2026.04 | 0.3568 | — | |
| Self-CertaintyBackbone=Qwen3-1.7B-Base2026.04 | 0.3528 | — | |
| JURY-RLBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3454 | — | |
| Self-CertaintyBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3442 | — | |
| GT-RewardBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3426 | — | |
| LLM-as-a-JudgeBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3422 | — | |
| LLM-KDBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3404 | — | |
| Majority-VotingBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3394 | — | |
| LLM-as-a-JudgeBackbone=Qwen3-1.7B-Base2026.04 | 0.3383 | — | |
| Before RLBackbone=Qwen3-1.7B-Base2026.04 | 0.336 | — | |
| EntropyBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3354 | — | |
| CoRewardBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3295 | — | |
| Before RLBackbone=Llama-3.2-3B-Instruct2026.04 | 0.3201 | — |