Science Question Answering on SuperGPQA
28.46Avg@kSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFTBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 28.46 | 53.83 | |
| RPSFTBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 27.84 | 54.57 | |
| IWBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 25.99 | 51.11 | |
| DFTBase Model=Qwen2.5-7B-Instruct, RL Stage=DAPO, k=42026.05 | 25.25 | 45.93 | |
| SFTBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 24.38 | 54.81 | |
| RPSFTBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 23.77 | 53.58 | |
| IWBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 22.28 | 49.14 | |
| RPSFTBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 21.67 | 48.89 | |
| SFTBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 19.81 | 45.68 | |
| IWBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 19.38 | 43.7 | |
| DFTBase Model=Qwen2.5-3B-Instruct, RL Stage=DAPO, k=42026.05 | 19.26 | 44.94 | |
| DFTBase Model=Llama-3.1-8B-Instruct, RL Stage=DAPO, k=42026.05 | 17.72 | 38.02 |