Open-domain Question Answering on TriviaQA (Acc. %, AUROC, ECE)
74Accuracy (%)HiPRAG
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| HiPRAGBackbone=Qwen2.5-7B-Instruct2026.05 | 74 | — | — | 2.04 | |
| SAASBackbone=Qwen2.5-7B-Instruct2026.05 | 74 | — | — | 0.56 | |
| Qwen3 30Bconfidence_type=normalized, evaluation_protocol=self-evaluation2026.02 | 72.99 | 0.859 | 18.1 | — | |
| Gemma3 12Bconfidence_type=normalized, evaluation_protocol=self-evaluation2026.02 | 72.04 | 0.814 | 23.1 | — | |
| SAASBackbone=Qwen2.5-3B-Instruct2026.05 | 69.2 | — | — | 0.66 | |
| HiPRAGBackbone=Qwen2.5-3B-Instruct2026.05 | 68.8 | — | — | 1.59 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct2026.05 | 68.3 | — | — | 1.11 | |
| StepSearchBackbone=Qwen2.5-7B-Instruct2026.05 | 67.8 | — | — | 1.28 | |
| RFTBackbone=Qwen2.5-7B-Instruct2026.05 | 67.5 | — | — | 0.92 | |
| Search-R1Backbone=Qwen2.5-3B-Instruct2026.05 | 65.7 | — | — | 1.22 | |
| GLM4 9Bconfidence_type=normalized, evaluation_protocol=self-evaluation2026.02 | 60.52 | 0.748 | 31.5 | — | |
| StepSearchBackbone=Qwen2.5-3B-Instruct2026.05 | 60 | — | — | 1.44 | |
| RFTBackbone=Qwen2.5-3B-Instruct2026.05 | 59.8 | — | — | 0.89 | |
| Direct InferenceBackbone=Qwen2.5-7B-Instruct2026.05 | 55.7 | — | — | — | |
| Qwen3 4Bconfidence_type=normalized, evaluation_protocol=self-evaluation2026.02 | 54.21 | 0.829 | 25.5 | — | |
| Gemma3 4Bconfidence_type=normalized, evaluation_protocol=self-evaluation2026.02 | 53.36 | 0.775 | 41.1 | — | |
| Direct InferenceBackbone=Qwen2.5-3B-Instruct2026.05 | 44.9 | — | — | — |