Question Answering on DROP nfl
67.69F1 ScoreToken-Guard
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Token-GuardBackbone=Qwen3-8B2026.01 | 67.69 | 66 | |
| Chain-of-ThoughtsBackbone=Qwen3-8B2026.01 | 59.89 | 49 | |
| Token-Guard2026.01 | 58.1 | — | |
| Token-GuardBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 58.1 | 44 | |
| BaseModelBackbone=Qwen3-8B2026.01 | 57.02 | 39 | |
| Tree-of-ThoughtBackbone=Qwen3-8B2026.01 | 54.67 | 34 | |
| Guided DecodingBackbone=Qwen3-8B2026.01 | 53.68 | 43 | |
| Chain-of-ThoughtsBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 49.21 | 34 | |
| SELF-REFINE2026.01 | 47.25 | — | |
| Self-RAG2026.01 | 45.29 | — | |
| Self-Reflection2026.01 | 42.05 | — | |
| BaseModel2026.01 | 39.1 | — | |
| BaseModelBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 39.1 | 30 | |
| Tree-of-ThoughtBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 37.69 | 24 | |
| Guided DecodingBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 36.71 | 18 | |
| Predictive DecodingBackbone=Meta-Llama-3.1-8B-Instruct2026.01 | 29.22 | 20 | |
| Predictive DecodingBackbone=Qwen3-8B2026.01 | 23.41 | 0 |