Question Answering on Bamboogle (subEM, Original EM)
50.4subEMSearch-R1 (GRPO, 14B)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Search-R1 (GRPO, 14B)Model Scale=14B, RL Algorithm=GRPO2025.10 | 50.4 | 49.2 | |
| DSPOModel Scale=7B, Dynamic Filter=true, Sequence-level Optimization=true2025.10 | 43.2 | — | |
| DSPO w/o dyn. filterModel Scale=7B, Dynamic Filter=false, Sequence-level Optimization=true2025.10 | 28.8 | — | |
| Search-R1 (GRPO, 7B)Model Scale=7B, RL Algorithm=GRPO2025.10 | 28 | 40 | |
| DSPO w/o seq-lvl opt.Model Scale=7B, Dynamic Filter=true, Sequence-level Optimization=false2025.10 | 28 | — | |
| Search-R1 (PPO, 14B)Model Scale=14B, RL Algorithm=PPO2025.10 | — | 48 | |
| Search-R1 (PPO, 7B)Model Scale=7B, RL Algorithm=PPO2025.10 | — | 36.8 |