Hallucination Detection on TruthfulQA 25% random (test)
0.8772AUROCARS (CCS)
Evaluation Results
| Method | Links | |
|---|---|---|
| ARS (CCS)Model=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=LRM-based2026.01 | 0.8772 | |
| ARS (Probing)Model=Qwen3-8B, Single Sampling=true, Supervision=true, Method Category=LRM-based2026.01 | 0.8365 | |
| TSVModel=Qwen3-8B, Single Sampling=true, Supervision=true, Method Category=Standard2026.01 | 0.8186 | |
| G-DetectorModel=Qwen3-8B, Single Sampling=true, Supervision=true, Method Category=LRM-based2026.01 | 0.7415 | |
| RACEModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=LRM-based2026.01 | 0.6972 | |
| Semantic EntropyModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=Standard2026.01 | 0.6054 | |
| PerplexityModel=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=Standard2026.01 | 0.5928 | |
| Lexical SimilarityModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=Standard2026.01 | 0.5922 | |
| RHDModel=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=LRM-based2026.01 | 0.5538 | |
| SelfCKGPTModel=Qwen3-8B, Single Sampling=false, Supervision=false, Method Category=Standard2026.01 | 0.5033 | |
| Verbalized CertaintyModel=Qwen3-8B, Single Sampling=true, Supervision=false, Method Category=Standard2026.01 | 0.4988 |