Multi-hop Question Answering on SynthWorlds-RM
26.9Exact Match (EM)Search-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| Search-R1Training Paradigm=RL-trained, Backbone=Qwen2.5-7B2026.06 | 26.9 | |
| ReActTraining Paradigm=Training-free, Backbone=Qwen2.5-7B2026.06 | 22.2 | |
| SARDITraining Paradigm=Training-free, Backbone=DREAM-7B, Retrieval Strategy=SARDI, Diffusion Threshold (tau_c)=0.952026.06 | 21.7 | |
| SARDITraining Paradigm=Training-free, Backbone=DREAM-7B, Retrieval Strategy=SARDI, Diffusion Threshold (tau_c)=0.92026.06 | 21.1 | |
| AR W/ RET@1Training Paradigm=Training-free, Backbone=Qwen2.5-7B, Retrieval Strategy=RET@12026.06 | 20.4 | |
| AR W/ RET@10Training Paradigm=Training-free, Backbone=Qwen2.5-7B, Retrieval Strategy=RET@102026.06 | 19.3 | |
| AR W/ RET@STATICTraining Paradigm=Training-free, Backbone=Qwen2.5-7B, Retrieval Strategy=STATIC2026.06 | 16.5 | |
| AR W/ RET@ADAPTIVETraining Paradigm=Training-free, Backbone=Qwen2.5-7B, Retrieval Strategy=ADAPTIVE2026.06 | 15.7 | |
| DLM W/ RET@STATICTraining Paradigm=Training-free, Backbone=DREAM-7B, Retrieval Strategy=STATIC, Diffusion Threshold (tau_c)=0.92026.06 | 14.4 | |
| AdaptiveRAGTraining Paradigm=Training-free, Backbone=Qwen2.5-7B2026.06 | 13.2 |