Question Answering on TruthfulQA 1.0 (test)
88% True (GPT-Judge)CoT with SSRAG
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CoT with SSRAGBackbone=LLaMA 2, Reasoning Strategy=Chain of Thought2026.01 | 88 | 81.2 | 87.1 | 0.18 | |
| SSRAGBackbone=GPT-4, Reasoning Strategy=None2026.01 | 87 | 82.3 | 86.4 | 0.18 | |
| CoVe with SSRAGBackbone=GPT-4, Reasoning Strategy=Chain of Verification2026.01 | 83 | 77 | 83 | 0.15 | |
| SSRAGBackbone=LLaMA 22026.01 | 83 | 75.2 | 82.4 | 0.23 | |
| SSRAGBackbone=Gemini 1.52026.01 | 82 | 85.2 | 91.6 | 0.29 | |
| CoT with SSRAGBackbone=GPT-4, Reasoning Strategy=Chain of Thought2026.01 | 81 | 83.4 | 82 | 0.16 | |
| SSRAGBackbone=IBM Granite2026.01 | 79 | 79.8 | 89.1 | 0.19 | |
| SSRAGBackbone=TinyLLaMA2026.01 | 75 | 81.1 | 91 | 0.27 | |
| Graph RAGBackbone=GPT-4, Reasoning Strategy=None2026.01 | 67 | 58 | 65 | 0.4 | |
| Graph RAGBackbone=LLaMA 22026.01 | 65 | 59.8 | 68 | 0.38 | |
| CoVe with GraphBackbone=GPT-4, Reasoning Strategy=Chain of Verification2026.01 | 64 | 57.7 | 57.9 | 0.42 | |
| CoT with Graph RAGBackbone=GPT-4, Reasoning Strategy=Chain of Thought2026.01 | 63 | 54.7 | 62.7 | 0.37 | |
| CoVeBackbone=GPT-4, Reasoning Strategy=Chain of Verification2026.01 | 58 | 48 | 41.1 | 0.47 | |
| Baseline RAGBackbone=GPT-4, Reasoning Strategy=None2026.01 | 57 | 43.2 | 47 | 0.51 | |
| CoTBackbone=GPT-4, Reasoning Strategy=Chain of Thought2026.01 | 57 | 47 | 45.4 | 0.47 | |
| Baseline RAGBackbone=Gemini 1.52026.01 | 56 | 50 | 55 | 0.49 | |
| Baseline RAGBackbone=LLaMA 22026.01 | 52 | 52.1 | 52 | 0.52 | |
| CoTBackbone=LLaMA 2, Reasoning Strategy=Chain of Thought2026.01 | 52 | 49.2 | 47.3 | 0.51 | |
| Baseline RAGBackbone=IBM Granite2026.01 | 52 | 51.4 | 53 | 0.45 | |
| Baseline RAGBackbone=TinyLLaMA2026.01 | 47 | 32.1 | 41 | 0.54 |