Massive Multitask Language Understanding on MMLU Pro (Avg@k, Pass@k)
68.21Avg@kRPSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RPSFTBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 68.21 | 84.29 | |
| DFTBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 66.07 | 80 | |
| SFTBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 64.64 | 80 | |
| IWBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 64.64 | 78.57 | |
| SFTBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 56.07 | 75.71 | |
| IWBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 52.86 | 77.14 | |
| RPSFTBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 52.86 | 81.43 | |
| DFTBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 50 | 75.71 | |
| RPSFTBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 43.93 | 72.86 | |
| IWBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 42.14 | 68.57 | |
| SFTBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 40.71 | 70 | |
| DFTBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 40.71 | 60 |