General Knowledge Task on MMLU-Pro (test)
56.3AccuracyQwen2.5 7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5 7BPost-train=SFT+RL, Model Type=Autoregressive, Number of shots=0, Evaluation Protocol=RL alignment (†)2026.01 | 56.3 | |
| Gemma2 9BPost-train=SFT+RL, Model Type=Autoregressive, Number of shots=0, Evaluation Protocol=RL alignment (†)2026.01 | 52.1 | |
| VDLMPost-train=SFT+RL, Model Type=Diffusion, Number of shots=0, Evaluation Protocol=same protocol (*)2026.01 | 47.8 | |
| Qwen2 7BPost-train=SFT+RL, Model Type=Autoregressive, Number of shots=0, Evaluation Protocol=RL alignment (†)2026.01 | 44.1 | |
| LLaMA3 8BPost-train=SFT+RL, Model Type=Autoregressive, Number of shots=0, Evaluation Protocol=same protocol (*)2026.01 | 41.9 | |
| LLaDA 8BPost-train=SFT, Model Type=Diffusion, Number of shots=0, Evaluation Protocol=same protocol (*)2026.01 | 37 |