Multi-Hop QA Verification on Musique
81.82P@1DiVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DiVABackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Enabled2026.01 | 81.82 | 73.59 | |
| DiVABackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Disabled2026.01 | 80.52 | 72.73 | |
| DiVABackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Enabled2026.01 | 79.87 | 77.92 | |
| Agentic-Generative ScorerBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=false2026.01 | 73.38 | 61.9 | |
| FactScore w/ GPT-42026.01 | 72.34 | 69.78 | |
| Agentic-Generative ScorerBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=false2026.01 | 68.18 | 65.37 | |
| Agentic-Generative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 66.23 | 58.44 | |
| DiVABackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=true, Training Efficiency=true, Compression=Disabled2026.01 | 65.58 | 58.01 | |
| Discriminative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=false, External Knowledge=false, Fine-grained Scoring=true, Training Efficiency=true2026.01 | 64.29 | 51.95 | |
| Discriminative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=false, External Knowledge=false, Fine-grained Scoring=true, Training Efficiency=true2026.01 | 61.04 | 40.69 | |
| Generative VerifierBackbone=Qwen-3-4B-Instruct, Agentic Reasoning=true, External Knowledge=false, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 59.85 | 50.36 | |
| Agentic-Generative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=true, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 57.79 | 53.25 | |
| Generative VerifierBackbone=Qwen-2.5-7B-Instruct, Agentic Reasoning=true, External Knowledge=false, Fine-grained Scoring=false, Training Efficiency=true2026.01 | 57.14 | 48.92 | |
| MiniCheck w/ MiniCheck-7B2026.01 | 53.25 | 46.75 | |
| HHEM-2.1-Open2026.01 | 50.65 | 46.32 | |
| MiniCheck w/ Flan-T52026.01 | 46.1 | 41.56 |