Multi-hop Question Answering on Antileak-m (test)
36.3EMDAVID-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DAVID-GRPOBackbone=Qwen2.5-1.5B, Training Budget=Low2026.01 | 36.3 | 41.1 | |
| DAVID-GRPOBackbone=Llama-3.2-1B, Training Budget=Low2026.01 | 23.3 | 31.7 | |
| StepSearchBackbone=Llama-3.2-1B, Training Budget=Low2026.01 | 22.4 | 31.4 | |
| Search-R1-v0.3Backbone=Qwen2.5-1.5B, Training Budget=Low, Method modifier=w/ retrieval reward2026.01 | 16.7 | 22.2 | |
| Tree-GRPOBackbone=Llama-3.2-1B, Training Budget=Low2026.01 | 16 | 20.7 | |
| Search-R1-v0.3Backbone=Llama-3.2-1B, Training Budget=Low, Method modifier=w/ retrieval reward2026.01 | 13 | 15.3 | |
| StepSearchBackbone=Qwen2.5-1.5B, Training Budget=Low2026.01 | 12.1 | 17.3 | |
| Tree-GRPOBackbone=Qwen2.5-1.5B, Training Budget=Low2026.01 | 11.7 | 15.7 | |
| DAVID-GRPOBackbone=Qwen2.5-0.5B, Training Budget=Low2026.01 | 10.6 | 14.4 | |
| Tree-GRPOBackbone=Qwen2.5-0.5B, Training Budget=Low2026.01 | 10.3 | 12.7 | |
| StepSearchBackbone=Qwen2.5-0.5B, Training Budget=Low2026.01 | 0.2 | 0.8 | |
| Search-R1-v0.3Backbone=Qwen2.5-0.5B, Training Budget=Low, Method modifier=w/ retrieval reward2026.01 | 0 | 0 |