Question Answering on Natural Questions (NQ) (Uncertainty & Calibration Metrics)
48.96AccuracyGPT-4
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-4Prompt Type=vanilla prompt2024.02 | 48.96 | 18.94 | 0.0456 | 0.3666 | 0.5878 | |
| FLARELLM=Llama-3.1-8B, Write-back=true2026.03 | 42.83 | — | — | — | — | |
| FLARELLM=Gemma-3-12B, Write-back=true2026.03 | 41.23 | — | — | — | — | |
| GPT-InstructPrompt Type=vanilla prompt2024.02 | 40.03 | 19 | 0.0346 | 0.4444 | 0.5211 | |
| FLARELLM=Llama-3.1-8B, Write-back=false2026.03 | 39.42 | — | — | — | — | |
| ChatGPTPrompt Type=vanilla prompt2024.02 | 38.5 | 29.17 | 0.0557 | 0.3789 | 0.5654 | |
| FLARELLM=Gemma-3-12B, Write-back=false2026.03 | 38.5 | — | — | — | — | |
| Self-RAGLLM=Llama-3.1-8B, Write-back=true2026.03 | 37.48 | — | — | — | — | |
| Self-RAGLLM=Gemma-3-12B, Write-back=true2026.03 | 36.53 | — | — | — | — | |
| Naive RAGLLM=Llama-3.1-8B, Write-back=true2026.03 | 35.84 | — | — | — | — | |
| RePlugLLM=Llama-3.1-8B, Write-back=true2026.03 | 35.53 | — | — | — | — | |
| Self-RAGLLM=Llama-3.1-8B, Write-back=false2026.03 | 35.18 | — | — | — | — | |
| Naive RAGLLM=Gemma-3-12B, Write-back=true2026.03 | 34.82 | — | — | — | — | |
| Self-RAGLLM=Gemma-3-12B, Write-back=false2026.03 | 34.77 | — | — | — | — | |
| RePlugLLM=Gemma-3-12B, Write-back=true2026.03 | 34.63 | — | — | — | — | |
| Naive RAGLLM=Llama-3.1-8B, Write-back=false2026.03 | 32.15 | — | — | — | — | |
| RePlugLLM=Llama-3.1-8B, Write-back=false2026.03 | 31.92 | — | — | — | — | |
| Naive RAGLLM=Gemma-3-12B, Write-back=false2026.03 | 31.44 | — | — | — | — | |
| RePlugLLM=Gemma-3-12B, Write-back=false2026.03 | 31.39 | — | — | — | — | |
| No RetrievalLLM=Gemma-3-12B2026.03 | 30.61 | — | — | — | — | |
| LLaMA2Prompt Type=vanilla prompt2024.02 | 29.86 | 16.84 | 0.0161 | 0.549 | 0.4349 | |
| No RetrievalLLM=Llama-3.1-8B2026.03 | 29.17 | — | — | — | — | |
| VicunaPrompt Type=vanilla prompt2024.02 | 26.34 | 2.78 | 0.0011 | 0.7099 | 0.2889 |