Single-hop Question Answering on TriviaQA (test)
66AccuracyGIGPO w/ PaW
Evaluation Results
| Method | Links | |
|---|---|---|
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 66 | |
| STAPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 66 | |
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 64.9 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 64.7 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 64.4 | |
| GRPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 63.9 | |
| InfoReasoner-3BRetrieval=true, Model Scale=3B2026.01 | 63.4 | |
| SE-Search-3BRetrieval=Agent w/ Retrieval2026.02 | 62.4 | |
| AutoRefine-BaseRetrieval=Agent w/ Retrieval2026.02 | 62 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 61.8 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 61.8 | |
| ZeroSearchBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 61.8 | |
| ZeroSearch-BaseRetrieval=Agent w/ Retrieval2026.02 | 61.6 | |
| InfoReasoner-7BRetrieval=true, Model Scale=7B2026.01 | 61.4 | |
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 61.2 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 61 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 61 | |
| GRPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 60.9 | |
| AutoRefine-7B-BaseRetrieval=true, Model Scale=7B2026.01 | 60.8 | |
| STAPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 60.7 | |
| ReSearch-BaseRetrieval=Agent w/ Retrieval2026.02 | 59.7 | |
| O2-SearcherRetrieval=Agent w/ Retrieval2026.02 | 59.7 | |
| AutoRefine-InstructRetrieval=Agent w/ Retrieval2026.02 | 59.7 | |
| InForageRetrieval=Agent w/ Retrieval2026.02 | 59.7 | |
| GiGPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 59.5 | |
| Search-R1-7B-InstructRetrieval=true, Model Scale=7B2026.01 | 59 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 58.5 | |
| Search-R1-BaseRetrieval=Agent w/ Retrieval2026.02 | 58.3 | |
| Search-R1-3B-BaseRetrieval=true, Model Scale=3B2026.01 | 58 | |
| ReasonRAG-7BRetrieval=true, Model Scale=7B2026.01 | 57.8 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 57.4 | |
| ZeroSearchBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 57.4 | |
| ReSearch-InstructRetrieval=Agent w/ Retrieval2026.02 | 57.1 | |
| ReSearch-7B-InstructRetrieval=true, Model Scale=7B2026.01 | 56.8 | |
| Search-R1-3B-InstructRetrieval=true, Model Scale=3B2026.01 | 56.6 | |
| Search-R1-InstructRetrieval=Agent w/ Retrieval2026.02 | 56.5 | |
| Search-R1-7B-BaseRetrieval=true, Model Scale=7B2026.01 | 55.6 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 54.5 | |
| Search-R1Backbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 54.5 | |
| RAGRetrieval=true, Model Scale=3B2026.01 | 54.4 | |
| Naive RAGRetrieval=Workflow w/ Retrieval2026.02 | 54.4 | |
| R1-InstructBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 53.7 | |
| AutoRefine-3B-InstructRetrieval=true, Model Scale=3B2026.01 | 52.2 | |
| InForge-3BRetrieval=true, Model Scale=3B2026.01 | 50.4 | |
| Search-o1Retrieval=true, Model Scale=3B2026.01 | 47.2 | |
| Search-o1Retrieval=Agent w/ Retrieval2026.02 | 47.2 | |
| R1-BaseRetrieval=false2026.01 | 45.5 | |
| R1-BaseRetrieval=w/o Retrieval2026.02 | 45.5 | |
| R1-InstructRetrieval=false2026.01 | 44.9 | |
| R1-InstructRetrieval=w/o Retrieval2026.02 | 44.9 | |
| R1-InstructBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 44.9 | |
| ReSearch-7B-BaseRetrieval=true, Model Scale=7B2026.01 | 44.6 | |
| AutoRefine-3B-BaseRetrieval=true, Model Scale=3B2026.01 | 42.8 | |
| IRCoTRetrieval=true, Model Scale=3B2026.01 | 31.2 | |
| IRCoTRetrieval=Workflow w/ Retrieval2026.02 | 31.2 | |
| SFTRetrieval=false2026.01 | 29.2 | |
| SFTRetrieval=w/o Retrieval2026.02 | 29.2 | |
| Direct GenerationRetrieval=false2026.01 | 28.8 | |
| Direct GenerationRetrieval=w/o Retrieval2026.02 | 28.8 | |
| CoTRetrieval=false2026.01 | 18.5 |