Multilingual Language Understanding on MMMLU (test)
66.88AccuracyMSD (Off-Policy)
Evaluation Results
| Method | Links | |
|---|---|---|
| MSD (Off-Policy)Base Model=Qwen-3-8B2026.05 | 66.88 | |
| MSD (On-Policy)Base Model=Qwen-3-8B2026.05 | 66.76 | |
| ORPOBase Model=Qwen-3-8B2026.05 | 65.49 | |
| SimPoBase Model=Qwen-3-8B2026.05 | 65.45 | |
| rDPOBase Model=Qwen-3-8B2026.05 | 65.26 | |
| KTOBase Model=Qwen-3-8B2026.05 | 65.23 | |
| R-DPOBase Model=Qwen-3-8B2026.05 | 65.23 | |
| DPOBase Model=Qwen-3-8B2026.05 | 65.15 | |
| SDRRLBase Model=Qwen-3-8B2026.05 | 65.07 | |
| MPOBase Model=Qwen-3-8B2026.05 | 64.78 | |
| RawBase Model=Qwen-3-8B2026.05 | 64.65 | |
| PolyRefuseBase Model=Qwen-3-8B2026.05 | 64.61 | |
| SFTBase Model=Qwen-3-8B2026.05 | 59.22 | |
| MSD (On-Policy)Base Model=Qwen-2.5-7B-Instruct2026.05 | 58.8 | |
| RawBase Model=Qwen-2.5-7B-Instruct2026.05 | 58.26 | |
| MSD (Off-Policy)Base Model=Qwen-2.5-7B-Instruct2026.05 | 58.25 | |
| MPOBase Model=Qwen-2.5-7B-Instruct2026.05 | 58.17 | |
| R-DPOBase Model=Qwen-2.5-7B-Instruct2026.05 | 58.06 | |
| DPOBase Model=Qwen-2.5-7B-Instruct2026.05 | 58.04 | |
| rDPOBase Model=Qwen-2.5-7B-Instruct2026.05 | 57.92 | |
| PolyRefuseBase Model=Qwen-2.5-7B-Instruct2026.05 | 57.9 | |
| KTOBase Model=Qwen-2.5-7B-Instruct2026.05 | 57.85 | |
| ORPOBase Model=Qwen-2.5-7B-Instruct2026.05 | 57.47 | |
| SDRRLBase Model=Qwen-2.5-7B-Instruct2026.05 | 57.34 | |
| SimPoBase Model=Qwen-2.5-7B-Instruct2026.05 | 57.16 | |
| SFTBase Model=Qwen-2.5-7B-Instruct2026.05 | 50.55 | |
| RawBase Model=LLaMA-3-8B-Instruct2026.05 | 48.17 | |
| MSD (On-Policy)Base Model=LLaMA-3-8B-Instruct2026.05 | 48.16 | |
| MPOBase Model=LLaMA-3-8B-Instruct2026.05 | 47.87 | |
| MSD (Off-Policy)Base Model=LLaMA-3-8B-Instruct2026.05 | 46.57 | |
| PolyRefuseBase Model=LLaMA-3-8B-Instruct2026.05 | 44.01 | |
| R-DPOBase Model=LLaMA-3-8B-Instruct2026.05 | 42.26 | |
| DPOBase Model=LLaMA-3-8B-Instruct2026.05 | 41.53 | |
| SimPoBase Model=LLaMA-3-8B-Instruct2026.05 | 35.31 | |
| ORPOBase Model=LLaMA-3-8B-Instruct2026.05 | 34.88 | |
| SDRRLBase Model=LLaMA-3-8B-Instruct2026.05 | 34.28 | |
| KTOBase Model=LLaMA-3-8B-Instruct2026.05 | 33.79 | |
| RawBase Model=LLaMA-2-7B-Chat2026.05 | 32.05 | |
| R-DPOBase Model=LLaMA-2-7B-Chat2026.05 | 32.01 | |
| MSD (On-Policy)Base Model=LLaMA-2-7B-Chat2026.05 | 31.97 | |
| rDPOBase Model=LLaMA-2-7B-Chat2026.05 | 31.96 | |
| MPOBase Model=LLaMA-2-7B-Chat2026.05 | 31.91 | |
| DPOBase Model=LLaMA-2-7B-Chat2026.05 | 31.86 | |
| KTOBase Model=LLaMA-2-7B-Chat2026.05 | 31.84 | |
| MSD (Off-Policy)Base Model=LLaMA-2-7B-Chat2026.05 | 31.61 | |
| ORPOBase Model=LLaMA-2-7B-Chat2026.05 | 31.49 | |
| SimPoBase Model=LLaMA-2-7B-Chat2026.05 | 31.33 | |
| PolyRefuseBase Model=LLaMA-2-7B-Chat2026.05 | 31.2 | |
| SDRRLBase Model=LLaMA-2-7B-Chat2026.05 | 27.11 | |
| SFTBase Model=LLaMA-2-7B-Chat2026.05 | 24 | |
| rDPOBase Model=LLaMA-3-8B-Instruct2026.05 | 22.86 | |
| SFTBase Model=LLaMA-3-8B-Instruct2026.05 | 17.65 |