Post-training Performance Evaluation on Llama 3.2-3B (val)
70.1Max PpostSFT889K -> DAPOdc
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFT889K -> DAPOdcParadigm=SFT-then-RL2025.12 | 70.1 | — | |
| SFT889K -> DAPOdParadigm=SFT-then-RL2025.12 | 68.7 | — | |
| SFT889KParadigm=SFT2025.12 | 67.1 | 0.4 | |
| Hard102K -> DAPOdcParadigm=SFT-then-RL2025.12 | 56.3 | — | |
| Hard102KParadigm=SFT2025.12 | 55.3 | 0.5 | |
| Uniform102K -> DAPOdcParadigm=SFT-then-RL2025.12 | 55.1 | — | |
| Easy102K -> DAPOdcParadigm=SFT-then-RL2025.12 | 53.7 | — | |
| Uniform102KParadigm=SFT2025.12 | 53.2 | 0.54 | |
| Easy102KParadigm=SFT2025.12 | 52 | 0.59 | |
| S1K -> DAPOdcParadigm=SFT-then-RL2025.12 | 24.9 | — | |
| S1KParadigm=SFT2025.12 | 24 | 0.7 | |
| UPTParadigm=Syn-SFT-RL2025.12 | 12.2 | — | |
| LUFFYParadigm=Syn-SFT-RL2025.12 | 8.5 | — | |
| Llama3.2-3BParadigm=-2025.12 | 2.3 | — | |
| DAPOdParadigm=Pure RL2025.12 | 2.2 | — |