Long-form Question Answering on LongFact FullP (100% polluted)
88.93VeriScore F1@kMIRAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| MIRAGEBackbone=GPT-4o-mini2026.07 | 88.93 | |
| No-RAGBackbone=GPT-4o-mini2026.07 | 86.9 | |
| MIRAGEBackbone=Qwen3-8B2026.07 | 85.11 | |
| No-RAGBackbone=Qwen3-8B2026.07 | 84.61 | |
| AstuteRAGBackbone=GPT-4o-mini2026.07 | 74.87 | |
| SelfRAGBackbone=GPT-4o-mini2026.07 | 71.57 | |
| BRIDGEBackbone=GPT-4o-mini2026.07 | 70.33 | |
| FLAREBackbone=GPT-4o-mini2026.07 | 69.32 | |
| BRIDGEBackbone=Qwen3-8B2026.07 | 66.41 | |
| DRAGINBackbone=GPT-4o-mini2026.07 | 65.4 | |
| AstuteRAGBackbone=Qwen3-8B2026.07 | 65.04 | |
| RetRobust-NLIBackbone=Qwen3-8B2026.07 | 62.95 | |
| RetRobust-NLIBackbone=GPT-4o-mini2026.07 | 62.47 | |
| FLAREBackbone=Qwen3-8B2026.07 | 58.03 | |
| DRAGINBackbone=Qwen3-8B2026.07 | 55.28 | |
| RARGBackbone=GPT-4o-mini2026.07 | 53.53 | |
| MADAMRAGBackbone=GPT-4o-mini2026.07 | 50.33 | |
| SelfRAGBackbone=Qwen3-8B2026.07 | 49.52 | |
| RAGBackbone=GPT-4o-mini2026.07 | 49.11 | |
| TrustRAGBackbone=GPT-4o-mini2026.07 | 49.01 | |
| RobustRAGBackbone=Qwen3-8B2026.07 | 48.35 | |
| MADAMRAGBackbone=Qwen3-8B2026.07 | 44.7 | |
| RobustRAGBackbone=GPT-4o-mini2026.07 | 43.14 | |
| RAGBackbone=Qwen3-8B2026.07 | 40.61 | |
| TrustRAGBackbone=Qwen3-8B2026.07 | 39.79 | |
| RARGBackbone=Qwen3-8B2026.07 | 36.39 |