Question Answering on RAGTruth
45.89F1 ScoreToken-Guard
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Token-GuardBackbone=Qwen3-8B2026.01 | 45.89 | 0.06 | |
| Token-Guard2026.01 | 43.94 | — | |
| Token-GuardBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 43.94 | 0.02 | |
| Guided DecodingBackbone=Qwen3-8B2026.01 | 39.35 | 0 | |
| BaseModelBackbone=Qwen3-8B2026.01 | 36.12 | 0 | |
| Tree-of-ThoughtBackbone=Qwen3-8B2026.01 | 36.07 | 0 | |
| Predictive DecodingBackbone=Qwen3-8B2026.01 | 34.51 | 0 | |
| Chain-of-ThoughtsBackbone=Qwen3-8B2026.01 | 33.78 | 0 | |
| Self-RAG2026.01 | 32.91 | — | |
| SELF-REFINE2026.01 | 28.93 | — | |
| Guided DecodingBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 22.21 | 0 | |
| Tree-of-ThoughtBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 21.33 | 0 | |
| Chain-of-ThoughtsBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 20.47 | 0 | |
| Self-Reflection2026.01 | 14.82 | — | |
| BaseModel2026.01 | 14.71 | — | |
| BaseModelBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 14.71 | 0 | |
| Predictive DecodingBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 14.48 | 0 |