Question Answering on CovidQA
47.64F1Token-Guard
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Token-Guard2026.01 | 47.64 | — | |
| Token-GuardBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 47.64 | 8 | |
| Token-GuardBackbone=Qwen3-8B2026.01 | 44.01 | 9 | |
| Tree-of-ThoughtBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 43.7 | 10 | |
| Guided DecodingBackbone=Qwen3-8B2026.01 | 43.19 | 7 | |
| BaseModelBackbone=Qwen3-8B2026.01 | 42.57 | 5 | |
| Self-RAG2026.01 | 42.48 | — | |
| Chain-of-ThoughtsBackbone=Qwen3-8B2026.01 | 41.63 | 0 | |
| Guided DecodingBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 40.43 | 4 | |
| Predictive DecodingBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 39.36 | 4 | |
| SELF-REFINE2026.01 | 38.66 | — | |
| Tree-of-ThoughtBackbone=Qwen3-8B2026.01 | 37.34 | 0 | |
| Chain-of-ThoughtsBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 36.84 | 8 | |
| Self-Reflection2026.01 | 33.76 | — | |
| BaseModel2026.01 | 32.33 | — | |
| BaseModelBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 32.33 | 2 | |
| Predictive DecodingBackbone=Qwen3-8B2026.01 | 31.92 | 0 |