Question Answering on MSMARCO
53.9ROUGE-LKIDGPT2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| KIDGPT2Backbone=GPT2, Implementation=Knowledge trie, Training Strategy=Inference-time optimization2022.04 | 53.9 | 47.4 | |
| FiD-T5Model Scale=large, Backbone=T5, Training Strategy=LM FT2022.04 | 53.1 | 51.9 | |
| FiD-T5Model Scale=base, Backbone=T5, Training Strategy=LM FT2022.04 | 47.3 | 45.3 | |
| Little KIDImplementation=naive (plain list), Training Strategy=Inference-time optimization2022.04 | 46.3 | 40.2 | |
| PPLMTraining Strategy=Inference-time optimization (LM FT / -)2022.04 | 26.6 | 23.4 | |
| RankCoTBackbone=Qwen2.5-14B-Instruct2025.02 | 24.62 | — | |
| RankCoTBackbone=MiniCPM3-4B2025.02 | 24.59 | — | |
| Diverse DecodingTraining Strategy=Inference-time optimization (LM FT / -)2022.04 | 22.9 | 27.5 | |
| SummaryBackbone=Llama3-8B-Instruct2025.02 | 22.67 | — | |
| RankCoTBackbone=Llama3-8B-Instruct2025.02 | 20.84 | — | |
| No RefinementBackbone=Llama3-8B-Instruct2025.02 | 20.73 | — | |
| RerankBackbone=Llama3-8B-Instruct2025.02 | 20.72 | — | |
| CoTBackbone=Llama3-8B-Instruct2025.02 | 19.52 | — | |
| No RefinementBackbone=Qwen2.5-14B-Instruct2025.02 | 18.5 | — | |
| No RefinementBackbone=MiniCPM3-4B2025.02 | 13.55 | — |