Token-level Hallucination Detection on Olym-Math
8.42S_incorQwen3-0.6B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-0.6BCategory=Backbone Models2026.05 | 8.42 | 98.37 | |
| Qwen3-1.7BCategory=Backbone Models2026.05 | 19.45 | 99.82 | |
| Qwen3-4BCategory=Backbone Models2026.05 | 39.39 | 99.86 | |
| R1-Qwen3-8BCategory=Critic Models2026.05 | 39.93 | 99.75 | |
| Qwen3-8BCategory=Backbone Models2026.05 | 46.02 | 99.76 | |
| GPT-4.1Category=Critic Models2026.05 | 49.8 | 96.99 | |
| QwQ-32BCategory=Critic Models2026.05 | 52.53 | 99.61 | |
| TOKENHD-0.6BCategory=Detector Models2026.05 | 64.99 | 93.21 | |
| TOKENHD-1.7BCategory=Detector Models2026.05 | 65.63 | 96.68 | |
| TOKENHD-4BCategory=Detector Models2026.05 | 66.95 | 96.54 | |
| TOKENHD-8BCategory=Detector Models2026.05 | 68.45 | 97.61 | |
| o4-miniCategory=Critic Models2026.05 | 70.32 | 99.8 | |
| o3Category=Labeler Models2026.05 | 79.36 | 99.77 | |
| GPT-5Category=Labeler Models2026.05 | 84.94 | 99.59 |