Question Answering on TriviaQA (EM, F1, R-L, BLEU)
62EMEvolveR
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| EvolveRBackbone Model=Qwen2.5-7B2025.10 | 62 | — | — | — | |
| LLaDA-8B + OSCAROSCAR correction=After2026.04 | 61.4 | 68.9 | 65.4 | 41.8 | |
| Search-R1-instructBackbone Model=Qwen2.5-7B2025.10 | 61 | — | — | — | |
| Rejection SamplingBackbone Model=Qwen2.5-7B2025.10 | 59.2 | — | — | — | |
| Search-R1-baseBackbone Model=Qwen2.5-3B2025.10 | 58.7 | — | — | — | |
| RAGBackbone Model=Qwen2.5-7B2025.10 | 58.5 | — | — | — | |
| EvolveRBackbone Model=Qwen2.5-3B2025.10 | 58.4 | — | — | — | |
| Teacher-3BModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B2025.08 | 56.9 | — | — | — | |
| Search-R1-instructBackbone Model=Qwen2.5-3B2025.10 | 54.5 | — | — | — | |
| RAGBackbone Model=Qwen2.5-3B2025.10 | 54.4 | — | — | — | |
| R1-baseBackbone Model=Qwen2.5-7B2025.10 | 53.9 | — | — | — | |
| Dream-7B + OSCAROSCAR correction=After2026.04 | 53.8 | 61.2 | 58.7 | — | |
| R1-instructBackbone Model=Qwen2.5-7B2025.10 | 53.7 | — | — | — | |
| GRIPBackbone=Qwen2.5-7B-Instruct2026.04 | 51.9 | 60.5 | 49.6 | — | |
| LLaDA-8BOSCAR correction=Before2026.04 | 51 | 58.2 | 55.1 | 33.2 | |
| GRIPBackbone=Qwen-3-4B-Instruct2026.04 | 49.9 | 59.1 | 48.2 | — | |
| Rejection SamplingBackbone Model=Qwen2.5-3B2025.10 | 48.8 | — | — | — | |
| Robust-RAGBackbone=Qwen2.5-7B-Instruct2026.04 | 48.7 | 56.7 | 46.7 | — | |
| DGPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 48.1 | — | — | — | |
| IRCoTBackbone Model=Qwen2.5-7B2025.10 | 47.8 | — | — | — | |
| Robust-RAGBackbone=Qwen-3-4B-Instruct2026.04 | 47.7 | 55.1 | 45.2 | — | |
| Search-o1Backbone Model=Qwen2.5-3B2025.10 | 47.2 | — | — | — | |
| Single-RAGBackbone=Qwen2.5-7B-Instruct2026.04 | 45.8 | 55.7 | 46.1 | — | |
| R1-baseBackbone Model=Qwen2.5-3B2025.10 | 45.5 | — | — | — | |
| R1-instructBackbone Model=Qwen2.5-3B2025.10 | 44.9 | — | — | — | |
| PPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 44.4 | — | — | — | |
| Search-o1Backbone Model=Qwen2.5-7B2025.10 | 44.3 | — | — | — | |
| DistiLLMModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 44.2 | — | — | — | |
| KDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 43.1 | — | — | — | |
| TAIDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 42.7 | — | — | — | |
| Dream-7BOSCAR correction=Before2026.04 | 42 | 50.5 | 48.3 | — | |
| SeqKDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 41.6 | — | — | — | |
| SFT → PPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 41.5 | — | — | — | |
| GKDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 40.8 | — | — | — | |
| Direct InferenceBackbone Model=Qwen2.5-7B2025.10 | 40.8 | — | — | — | |
| R1-SearcherBackbone=Qwen2.5-7B-Instruct2026.04 | 40.1 | 48.3 | 39.4 | — | |
| InstructBackbone=Qwen2.5-7B-Instruct2026.04 | 37.1 | 44.4 | 36 | — | |
| R1-SearcherBackbone=Qwen-3-4B-Instruct2026.04 | 36.7 | 43.5 | 35.1 | — | |
| Single-RAGBackbone=Qwen-3-4B-Instruct2026.04 | 36 | 46 | 38 | — | |
| SFTBackbone Model=Qwen2.5-7B2025.10 | 35.4 | — | — | — | |
| IRCoTBackbone Model=Qwen2.5-3B2025.10 | 31.2 | — | — | — | |
| SFTBackbone Model=Qwen2.5-3B2025.10 | 29.2 | — | — | — | |
| Direct InferenceBackbone Model=Qwen2.5-3B2025.10 | 28.8 | — | — | — | |
| InstructBackbone=Qwen-3-4B-Instruct2026.04 | 22.1 | 30.1 | 24.1 | — | |
| CoTBackbone Model=Qwen2.5-7B2025.10 | 18.5 | — | — | — | |
| CoTBackbone Model=Qwen2.5-3B2025.10 | 3.2 | — | — | — | |
| Student-0.5BModel Family=Qwen 2.5, Student Model=Qwen 2.5 0.5B2025.08 | 0.6 | — | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Agreeableness, Direction=+2026.04 | -0.1 | -0.49 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Conscientiousness, Direction=+2026.04 | -0.6 | -1.37 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Agreeableness, Direction=+2026.04 | -1.2 | -1.02 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Openness, Direction=+2026.04 | -1.5 | -1.39 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Conscientiousness, Direction=+2026.04 | -1.9 | -2.17 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Openness, Direction=+2026.04 | -2.8 | -2.21 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Average, Direction=+2026.04 | -3.98 | -2.88 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Neuroticism, Direction=-2026.04 | -4.6 | -3.28 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Agreeableness, Direction=-2026.04 | -5.3 | -3.44 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Conscientiousness, Direction=-2026.04 | -5.5 | -3.39 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Average, Direction=-2026.04 | -5.86 | -3.8 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Average, Direction=+2026.04 | -6.24 | -4.35 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Neuroticism, Direction=-2026.04 | -6.3 | -4.26 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Extraversion, Direction=-2026.04 | -6.6 | -4.41 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Openness, Direction=-2026.04 | -7.3 | -4.49 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Agreeableness, Direction=-2026.04 | -8 | -4.96 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Average, Direction=-2026.04 | -8.18 | -5.26 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Extraversion, Direction=+2026.04 | -8.4 | -5.32 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Extraversion, Direction=-2026.04 | -8.7 | -5.81 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Conscientiousness, Direction=-2026.04 | -8.8 | -5.54 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Openness, Direction=-2026.04 | -9.1 | -5.74 | — | — | |
| DPN-LEwBackbone=LLaMA-3-8B-Instruct, gamma=0.8, Trait=Neuroticism, Direction=+2026.04 | -9.3 | -5.83 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Extraversion, Direction=+2026.04 | -11.8 | -7.85 | — | — | |
| DPN-LEBackbone=LLaMA-3-8B-Instruct, Trait=Neuroticism, Direction=+2026.04 | -13.5 | -8.5 | — | — | |
| CoTSystem=Basic LLM2026.03 | — | 61.8 | — | — | |
| Direct InferSystem=Basic LLM2026.03 | — | 34.7 | — | — | |
| Graph-R1System=RL-based Agent2026.03 | — | 59.7 | — | — | |
| GraphRAGSystem=RAG-Based2026.03 | — | 70.5 | — | — | |
| GraphRAG-RouterSystem=Our Method2026.03 | — | 73.5 | — | — | |
| GraphSearchSystem=Training-free Agent2026.03 | — | 68.3 | — | — | |
| HippoRAG2System=RAG-Based2026.03 | — | 66.8 | — | — | |
| HyperGraphRAGSystem=RAG-Based2026.03 | — | 65.6 | — | — | |
| LinearRAGSystem=RAG-Based2026.03 | — | 66.1 | — | — | |
| RAPTORSystem=RAG-Based2026.03 | — | 68.4 | — | — | |
| Router-R1System=RL-based Agent2026.03 | — | 72.3 | — | — | |
| Search-o1System=Training-free Agent2026.03 | — | 67.2 | — | — | |
| Search-R1System=RL-based Agent2026.03 | — | 61.7 | — | — | |
| Vanilla RAGSystem=RAG-Based2026.03 | — | 62.3 | — | — |