Hallucination Detection on MATH-500 (25% random test)
0.7943AUROCARS (CCS)
Evaluation Results
| Method | Links | |
|---|---|---|
| ARS (CCS)Model=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=LRM-based2026.01 | 0.7943 | |
| ARS (Probing)Model=Qwen3-8B, Single Sampling=true, Supervision=true, Method Category=LRM-based2026.01 | 0.7377 | |
| TSVModel=Qwen3-8B, Single Sampling=true, Supervision=true, Method Category=Standard2026.01 | 0.714 | |
| G-DetectorModel=Qwen3-8B, Single Sampling=true, Supervision=true, Method Category=LRM-based2026.01 | 0.5832 | |
| RACEModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=LRM-based2026.01 | 0.5683 | |
| SelfCKGPTModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=Standard2026.01 | 0.5359 | |
| PerplexityModel=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=Standard2026.01 | 0.4852 | |
| RHDModel=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=LRM-based2026.01 | 0.4807 | |
| Semantic EntropyModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=Standard2026.01 | 0.4747 | |
| Lexical SimilarityModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=Standard2026.01 | 0.4634 | |
| Verbalized CertaintyModel=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=Standard2026.01 | 0.4587 |