Code vulnerability detection on Devign 8 (test)
0.953Pearson CorrelationToken Impossibility Score
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Token Impossibility ScoreBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | 0.953 | 0 | |
| Avg Neg Log-LikelihoodBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | 0.829 | 0 | |
| PerplexityBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | 0.506 | 0 | |
| Avg ProbabilityBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | 0.295 | 0.0389 | |
| Token Impossibility ScoreBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | 0.295 | 0.0389 | |
| Avg Neg Log-LikelihoodBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | 0.293 | 0.0214 | |
| Stable Exp ConfBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Reasoning-Level Methods2025.12 | 0.256 | 0.2971 | |
| PerplexityBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | 0.207 | 0.0781 | |
| Max Token EntropyBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | 0.185 | 0.0913 | |
| DeepGiniBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | 0.18 | 0.0423 | |
| SPUQBackbone=ChatGLM3, Training Mode=pre-trained, Sample Size=10, UQ Method Category=Input-Level Sensitivity Methods2025.12 | 0.137 | 0.1846 | |
| ICE (Clarif. Ens.)Backbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Input-Level Sensitivity Methods2025.12 | 0.128 | 0.1964 | |
| Max Token EntropyBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | 0.127 | 0 | |
| DeepGiniBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | 0.118 | 0 | |
| MC Dropout VarBackbone=CodeBERT, Training Mode=fine-tuned, Sample Size=10, UQ Method Category=Ensemble-Based Methods2025.12 | 0.049 | 0.0933 | |
| MC Dropout VarBackbone=ChatGLM3, Training Mode=pre-trained, Sample Size=10, UQ Method Category=Ensemble-Based Methods2025.12 | 0.045 | 0.2483 | |
| CoT-UQBackbone=ChatGLM3, Training Mode=pre-trained, Sample Size=10, UQ Method Category=Reasoning-Level Methods2025.12 | 0.045 | 0.2451 | |
| Logit Lens EntropyBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Representation-Based Methods2025.12 | -0.018 | 0.5795 | |
| Logit Lens EntropyBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Representation-Based Methods2025.12 | -0.021 | 0.462 | |
| MarginBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | -0.106 | 0.0003 | |
| MarginBackbone=ChatGLM3, Training Mode=pre-trained, UQ Method Category=Predictive Distribution Methods2025.12 | -0.111 | 0.1892 | |
| Avg ProbabilityBackbone=CodeBERT, Training Mode=fine-tuned, UQ Method Category=Predictive Distribution Methods2025.12 | -0.953 | 0 |