Long-form Question Answering on AlpacaFact FullP (100% polluted)
78.65VeriScore F1@kMIRAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| MIRAGEBackbone=GPT-4o-mini2026.07 | 78.65 | |
| No-RAGBackbone=GPT-4o-mini2026.07 | 76.41 | |
| MIRAGEBackbone=Qwen3-8B2026.07 | 67.79 | |
| No-RAGBackbone=Qwen3-8B2026.07 | 65.71 | |
| SelfRAGBackbone=GPT-4o-mini2026.07 | 65.68 | |
| RetRobust-NLIBackbone=GPT-4o-mini2026.07 | 64.53 | |
| AstuteRAGBackbone=GPT-4o-mini2026.07 | 63.76 | |
| BRIDGEBackbone=GPT-4o-mini2026.07 | 62.38 | |
| DRAGINBackbone=GPT-4o-mini2026.07 | 61.47 | |
| AstuteRAGBackbone=Qwen3-8B2026.07 | 60.3 | |
| RetRobust-NLIBackbone=Qwen3-8B2026.07 | 57.2 | |
| BRIDGEBackbone=Qwen3-8B2026.07 | 56.66 | |
| FLAREBackbone=GPT-4o-mini2026.07 | 55.67 | |
| RAGBackbone=GPT-4o-mini2026.07 | 52.9 | |
| SelfRAGBackbone=Qwen3-8B2026.07 | 50.63 | |
| FLAREBackbone=Qwen3-8B2026.07 | 46.17 | |
| RARGBackbone=GPT-4o-mini2026.07 | 45.63 | |
| RobustRAGBackbone=Qwen3-8B2026.07 | 44.32 | |
| DRAGINBackbone=Qwen3-8B2026.07 | 43.93 | |
| TrustRAGBackbone=GPT-4o-mini2026.07 | 43.15 | |
| MADAMRAGBackbone=GPT-4o-mini2026.07 | 40.54 | |
| RAGBackbone=Qwen3-8B2026.07 | 38.43 | |
| TrustRAGBackbone=Qwen3-8B2026.07 | 37.69 | |
| MADAMRAGBackbone=Qwen3-8B2026.07 | 36.04 | |
| RARGBackbone=Qwen3-8B2026.07 | 35.87 | |
| RobustRAGBackbone=GPT-4o-mini2026.07 | 26.46 |