Question Answering on PopQA (subEM, Original EM)
49.8subEMDSPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSPOModel Scale=7B, Dynamic Filter=true, Sequence-level Optimization=true2025.10 | 49.8 | — | |
| Search-R1 (GRPO, 14B)Model Scale=14B, RL Algorithm=GRPO2025.10 | 47.7 | 43.4 | |
| DSPO w/o seq-lvl opt.Model Scale=7B, Dynamic Filter=true, Sequence-level Optimization=false2025.10 | 43 | — | |
| Search-R1 (GRPO, 7B)Model Scale=7B, RL Algorithm=GRPO2025.10 | 39.5 | 42.7 | |
| DSPO w/o dyn. filterModel Scale=7B, Dynamic Filter=false, Sequence-level Optimization=true2025.10 | 27.7 | — | |
| Search-R1 (PPO, 14B)Model Scale=14B, RL Algorithm=PPO2025.10 | — | 44.2 | |
| Search-R1 (PPO, 7B)Model Scale=7B, RL Algorithm=PPO2025.10 | — | 39.7 |