Multi-hop Question Answering on StrategyQA (test)
77.12AccuracyGenGround
Evaluation Results
| Method | Links | |
|---|---|---|
| GenGroundRetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo2024.06 | 77.12 | |
| SearChainRetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo2024.06 | 76.95 | |
| GRG w/ decompositionRetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo, Decomposition=true2024.06 | 75.21 | |
| RetGenRetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo2024.06 | 73.42 | |
| GeniusTraining Corpus=Magpie (25K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 72.53 | |
| DSPyRetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo2024.06 | 71.78 | |
| SPINTraining Corpus=Magpie (25K), Supervision Level=With Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 71.35 | |
| CoT-SCRetrieval Strategy=w/o Retrieval, Backbone=gpt-3.5-turbo2024.06 | 70.84 | |
| GeniusTraining Corpus=OpenHermes2.5 (32K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 70.79 | |
| Self-RewardingTraining Corpus=Magpie (25K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 70.48 | |
| CoHTraining Corpus=OpenHermes2.5 (32K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 69.91 | |
| CoHTraining Corpus=Magpie (25K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 69.08 | |
| ReActRetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo2024.06 | 68.37 | |
| GenRead w/ decompositionRetrieval Strategy=w/o Retrieval, Backbone=gpt-3.5-turbo, Decomposition=true2024.06 | 68.13 | |
| CoTRetrieval Strategy=w/o Retrieval, Backbone=gpt-3.5-turbo2024.06 | 67.83 | |
| Self-RewardingTraining Corpus=OpenHermes2.5 (32K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 67.55 | |
| GenReadRetrieval Strategy=w/o Retrieval, Backbone=gpt-3.5-turbo2024.06 | 67.13 | |
| VERetrieval Strategy=w/ Retrieval, Backbone=gpt-3.5-turbo2024.06 | 63.07 | |
| SCPOTraining Corpus=Magpie (25K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 59.87 | |
| SPINTraining Corpus=OpenHermes2.5 (32K), Supervision Level=With Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 59 | |
| LLaMA3.1-8B-InstructReasoning Strategy=CoT, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 58.91 | |
| SCPOTraining Corpus=OpenHermes2.5 (32K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 58.65 | |
| SFTTraining Corpus=Magpie (25K), Supervision Level=With Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 57.34 | |
| SFTTraining Corpus=OpenHermes2.5 (32K), Supervision Level=With Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 48.47 | |
| STaRTraining Corpus=Magpie (25K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 33.36 | |
| STaRTraining Corpus=OpenHermes2.5 (32K), Supervision Level=Without Supervision, Backbone Model=LLaMA3.1-8B-Instruct2025.04 | 19.34 |