Multi-Hop QA Verification on 2WikiMultihopQA
81.21P@1DiVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DiVABackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Enabled2026.01 | 81.21 | 69.35 | |
| DiVABackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Enabled2026.01 | 76.51 | 68.68 | |
| DiVABackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Disabled2026.01 | 72.82 | 66.44 | |
| Agentic-Generative ScorerBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=false2026.01 | 72.2 | 55.71 | |
| Agentic-Generative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 71.14 | 50.56 | |
| FactScore w/ GPT-42026.01 | 68.95 | 62.46 | |
| Agentic-Generative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 67.11 | 49.22 | |
| Agentic-Generative ScorerBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=false2026.01 | 66.11 | 42.73 | |
| DiVABackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Disabled2026.01 | 65.1 | 51.68 | |
| Discriminative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=false, External Knowledge=false, Fine-grained Scoring=true, Training Efficiency=true2026.01 | 59.6 | 34.9 | |
| Discriminative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=false, External Knowledge=false, Fine-grained Scoring=true, Training Efficiency=true2026.01 | 59.4 | 32.89 | |
| HHEM-2.1-Open2026.01 | 58.72 | 47.43 | |
| MiniCheck w/ MiniCheck-7B2026.01 | 58.05 | 53.69 | |
| Generative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=false, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 52.07 | 31.72 | |
| MiniCheck w/ Flan-T52026.01 | 51.34 | 48.1 | |
| Generative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=false, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 48.15 | 24.13 |