Token-level Hallucination Detection on AIME 2024
9.29S_incor ScoreQwen3-0.6B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-0.6BCategory=Backbone Models2026.05 | 9.29 | 100 | |
| Qwen3-1.7BCategory=Backbone Models2026.05 | 18.99 | 100 | |
| R1-Qwen3-8BCategory=Critic Models2026.05 | 34.51 | 100 | |
| Qwen3-4BCategory=Backbone Models2026.05 | 36.78 | 100 | |
| Qwen3-8BCategory=Backbone Models2026.05 | 47.03 | 100 | |
| GPT-4.1Category=Critic Models2026.05 | 50.2 | 99.37 | |
| QwQ-32BCategory=Critic Models2026.05 | 50.59 | 100 | |
| TOKENHD-1.7BCategory=Detector Models2026.05 | 59.57 | 96.79 | |
| TOKENHD-0.6BCategory=Detector Models2026.05 | 61.41 | 90.12 | |
| TOKENHD-8BCategory=Detector Models2026.05 | 63.62 | 98.44 | |
| TOKENHD-4BCategory=Detector Models2026.05 | 63.7 | 96.62 | |
| o4-miniCategory=Critic Models2026.05 | 67.67 | 100 | |
| o3Category=Labeler Models2026.05 | 80.44 | 100 | |
| GPT-5Category=Labeler Models2026.05 | 84.01 | 100 |