General Question Answering on TriviaQA (Exact Match)
69.02Exact MatchAgentic-R
Evaluation Results
| Method | Links | |
|---|---|---|
| Agentic-RSearch Agent=Our Search Agent, Search Agent Domain=in-domain2026.01 | 69.02 | |
| TSPOBackbone=Qwen2.5-7b-Instruct2026.01 | 68.7 | |
| REPLUGSearch Agent=Our Search Agent, Search Agent Domain=in-domain2026.01 | 65.78 | |
| Agentic-RSearch Agent=SimpleDeepSearcher, Search Agent Domain=out-of-domain2026.01 | 65.61 | |
| ZeroSearchBackbone=Qwen2.5-7b-Instruct2026.01 | 65.5 | |
| TSPOBackbone=Qwen2.5-3b-Instruct2026.01 | 65.5 | |
| MT-PPOBackbone=Qwen2.5-7b-Instruct2026.01 | 64.9 | |
| E5Search Agent=Our Search Agent, Search Agent Domain=in-domain2026.01 | 64.72 | |
| BGESearch Agent=Our Search Agent, Search Agent Domain=in-domain2026.01 | 63.66 | |
| REPLUGSearch Agent=SimpleDeepSearcher, Search Agent Domain=out-of-domain2026.01 | 63.59 | |
| SCARLetSearch Agent=Our Search Agent, Search Agent Domain=in-domain2026.01 | 63.46 | |
| Agentic-RSearch Agent=R1-Searcher, Search Agent Domain=out-of-domain2026.01 | 62.52 | |
| E5Search Agent=SimpleDeepSearcher, Search Agent Domain=out-of-domain2026.01 | 62.48 | |
| REPLUGSearch Agent=R1-Searcher, Search Agent Domain=out-of-domain2026.01 | 62.39 | |
| LLM-EmbedderSearch Agent=Our Search Agent, Search Agent Domain=in-domain2026.01 | 62.33 | |
| Search-R1Backbone=Qwen2.5-7b-Instruct2026.01 | 61 | |
| SCARLetSearch Agent=SimpleDeepSearcher, Search Agent Domain=out-of-domain2026.01 | 60.81 | |
| BGESearch Agent=SimpleDeepSearcher, Search Agent Domain=out-of-domain2026.01 | 60.73 | |
| SubSearch-base (Ours)Alg.=GRPO, Supervision=RL (SFT-Free)2026.04 | 59.7 | |
| InForage-instructAlg.=PPO, Supervision=SFT + RL (Upper Bound)2026.04 | 59.7 | |
| O2-Searcher-instructAlg.=GRPO, Supervision=SFT + RL (Upper Bound)2026.04 | 59.7 | |
| LLM-EmbedderSearch Agent=SimpleDeepSearcher, Search Agent Domain=out-of-domain2026.01 | 59.59 | |
| Rejection SamplingBackbone=Qwen2.5-7b-Instruct2026.01 | 59.2 | |
| E5Search Agent=R1-Searcher, Search Agent Domain=out-of-domain2026.01 | 58.69 | |
| RAGBackbone=Qwen2.5-7b-Instruct2026.01 | 58.5 | |
| Search-R1-baseAlg.=GRPO, Supervision=RL (SFT-Free)2026.04 | 58.3 | |
| SCARLetSearch Agent=R1-Searcher, Search Agent Domain=out-of-domain2026.01 | 57.64 | |
| ZeroSearchBackbone=Qwen2.5-3b-Instruct2026.01 | 57.4 | |
| ZeroSearch-instructAlg.=REINF., Supervision=RL (SFT-Free)2026.04 | 57.4 | |
| BGESearch Agent=R1-Searcher, Search Agent Domain=out-of-domain2026.01 | 57.19 | |
| Search-R1-instructAlg.=GRPO, Supervision=RL (SFT-Free)2026.04 | 56.5 | |
| LLM-EmbedderSearch Agent=R1-Searcher, Search Agent Domain=out-of-domain2026.01 | 56.29 | |
| Query Decomp-base (Ours)Alg.=GRPO, Supervision=RL (SFT-Free)2026.04 | 56 | |
| ZeroSearch-baseAlg.=GRPO, Supervision=RL (SFT-Free)2026.04 | 55.8 | |
| Search-R1Backbone=Qwen2.5-3b-Instruct2026.01 | 54.5 | |
| RAGBackbone=Qwen2.5-3b-Instruct2026.01 | 54.4 | |
| RAGAlg.=–, Supervision=Baselines2026.04 | 54.4 | |
| R-Search-instruct (r.)Alg.=GRPO, Supervision=RL (SFT-Free)2026.04 | 54.1 | |
| R1-instructBackbone=Qwen2.5-7b-Instruct2026.01 | 53.7 | |
| Rejection SamplingBackbone=Qwen2.5-3b-Instruct2026.01 | 48.8 | |
| IRCoTBackbone=Qwen2.5-7b-Instruct2026.01 | 47.8 | |
| Search-o1Backbone=Qwen2.5-3b-Instruct2026.01 | 47.2 | |
| Search-o1Alg.=–, Supervision=Baselines2026.04 | 47.2 | |
| R1-baseAlg.=PPO, Supervision=RL (SFT-Free)2026.04 | 45.5 | |
| R1-instructBackbone=Qwen2.5-3b-Instruct2026.01 | 44.9 | |
| Search-o1Backbone=Qwen2.5-7b-Instruct2026.01 | 44.3 | |
| Direct InferenceBackbone=Qwen2.5-7b-Instruct2026.01 | 40.8 | |
| SFTBackbone=Qwen2.5-7b-Instruct2026.01 | 35.4 | |
| IRCoTBackbone=Qwen2.5-3b-Instruct2026.01 | 31.2 | |
| SFTBackbone=Qwen2.5-3b-Instruct2026.01 | 29.2 | |
| SFTAlg.=–, Supervision=Baselines2026.04 | 29.2 | |
| Direct InferenceBackbone=Qwen2.5-3b-Instruct2026.01 | 28.8 | |
| Direct InferenceAlg.=–, Supervision=Baselines2026.04 | 28.8 | |
| CoTAlg.=–, Supervision=Baselines2026.04 | 3.2 |