Multi-Hop QA Verification on HotpotQA
87.8P@1DiVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DiVABackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Enabled2026.01 | 87.8 | 80.49 | |
| DiVABackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Disabled2026.01 | 83.62 | 73.75 | |
| DiVABackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Enabled2026.01 | 83.28 | 77.24 | |
| Agentic-Generative ScorerBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=false2026.01 | 80.28 | 69.95 | |
| Agentic-Generative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 78.05 | 66.78 | |
| Agentic-Generative ScorerBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=false2026.01 | 75.26 | 59.12 | |
| FactScore w/ GPT-42026.01 | 73.21 | 54.51 | |
| DiVABackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Disabled2026.01 | 72.82 | 64.46 | |
| Agentic-Generative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 72.13 | 60.51 | |
| Generative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=false, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 63.99 | 41.96 | |
| Discriminative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=false, External Knowledge=false, Fine-grained Scoring=true, Training Efficiency=true2026.01 | 63.76 | 45.18 | |
| MiniCheck w/ MiniCheck-7B2026.01 | 62.72 | 50.99 | |
| Discriminative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=false, External Knowledge=false, Fine-grained Scoring=true, Training Efficiency=true2026.01 | 58.54 | 43.55 | |
| MiniCheck w/ Flan-T52026.01 | 56.99 | 47.4 | |
| Generative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=false, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 55.39 | 41.76 | |
| HHEM-2.1-Open2026.01 | 52.61 | 33.8 |