Question Answering on TriviaQA (subEM, Original EM)
76subEMSearch-R1 (GRPO, 14B)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Search-R1 (GRPO, 14B)Model Scale=14B, RL Algorithm=GRPO2025.10 | 76 | 66.7 | |
| DSPOModel Scale=7B, Dynamic Filter=true, Sequence-level Optimization=true2025.10 | 75.4 | — | |
| DSPO w/o seq-lvl opt.Model Scale=7B, Dynamic Filter=true, Sequence-level Optimization=false2025.10 | 69.5 | — | |
| Search-R1 (GRPO, 7B)Model Scale=7B, RL Algorithm=GRPO2025.10 | 65.8 | 62.3 | |
| DSPO w/o dyn. filterModel Scale=7B, Dynamic Filter=false, Sequence-level Optimization=true2025.10 | 51.5 | — | |
| Search-R1 (PPO, 14B)Model Scale=14B, RL Algorithm=PPO2025.10 | — | 66 | |
| Search-R1 (PPO, 7B)Model Scale=7B, RL Algorithm=PPO2025.10 | — | 61 |