Question Answering on HotpotQA (subEM, Original EM)
61.3SubEMDSPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSPOModel Scale=7B, Dynamic Filter=true, Sequence-level Optimization=true2025.10 | 61.3 | — | |
| Search-R1 (GRPO, 14B)Model Scale=14B, RL Algorithm=GRPO2025.10 | 56.3 | 42.9 | |
| DSPO w/o seq-lvl opt.Model Scale=7B, Dynamic Filter=true, Sequence-level Optimization=false2025.10 | 43.8 | — | |
| Search-R1 (GRPO, 7B)Model Scale=7B, RL Algorithm=GRPO2025.10 | 40.1 | 38.6 | |
| DSPO w/o dyn. filterModel Scale=7B, Dynamic Filter=false, Sequence-level Optimization=true2025.10 | 33 | — | |
| Search-R1 (PPO, 14B)Model Scale=14B, RL Algorithm=PPO2025.10 | — | 43.6 | |
| Search-R1 (PPO, 7B)Model Scale=7B, RL Algorithm=PPO2025.10 | — | 37 |