Correctness Prediction (AUROC) on GSM8K
80.7AUROCQwen 2.5
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen 2.5Classifier=Logistic Regression2026.05 | 80.7 | |
| Qwen 2.5Classifier=Gradient Boosting2026.05 | 78.7 | |
| DeepSeek R1Classifier=Logistic Regression2026.05 | 78.6 | |
| Llama 3.1Classifier=Logistic Regression2026.05 | 78.3 | |
| DeepSeek R1Classifier=Gradient Boosting2026.05 | 77.5 | |
| Llama 3.2Classifier=Gradient Boosting2026.05 | 76.7 | |
| Llama 3.1Classifier=Gradient Boosting2026.05 | 75.8 | |
| Llama 3.2Classifier=Logistic Regression2026.05 | 75.8 | |
| Qwen 3Classifier=Self-Certainty2026.05 | 72.8 | |
| Qwen 3Classifier=Logistic Regression2026.05 | 72.7 | |
| DeepSeek R1Classifier=Self-Certainty2026.05 | 70.3 | |
| Qwen 2.5Classifier=Self-Certainty2026.05 | 68.9 | |
| Qwen 3Classifier=Gradient Boosting2026.05 | 66.5 | |
| DirectionModel=Qwen 2.5 7B Instruct, Train dataset=TriviaQA2025.09 | 60.1 | |
| Verb. conf.Model=Llama 3.3 70B Instruct2025.09 | 59.8 | |
| AssessorModel=Ministral 8B Instruct 2410, Assessor type=logistic regression2025.09 | 59.8 | |
| AssessorModel=Qwen 2.5 7B Instruct, Assessor type=logistic regression2025.09 | 58.4 | |
| DirectionModel=Mistral 7B Instruct v0.3, Train dataset=TriviaQA2025.09 | 57.9 | |
| DirectionModel=Ministral 8B Instruct 2410, Train dataset=TriviaQA2025.09 | 57.8 | |
| Verb. conf.Model=Ministral 8B Instruct 24102025.09 | 57.7 | |
| AssessorModel=DeepSeek R1 Distill Qwen 32B, Assessor type=logistic regression2025.09 | 57.6 | |
| AssessorModel=Llama 3.3 70B Instruct, Assessor type=logistic regression2025.09 | 57.3 | |
| Llama 3.2Classifier=Self-Certainty2026.05 | 56.6 | |
| AssessorModel=Mistral 7B Instruct v0.3, Assessor type=logistic regression2025.09 | 55.9 | |
| AssessorModel=Llama 3.1 8B, Assessor type=logistic regression2025.09 | 55.8 | |
| DirectionModel=DeepSeek R1 Distill Qwen 32B, Train dataset=TriviaQA2025.09 | 55.2 | |
| Verb. conf.Model=Llama 3.1 8B2025.09 | 54 | |
| DirectionModel=Llama 3.1 8B, Train dataset=TriviaQA2025.09 | 53.4 | |
| Verb. conf.Model=Mistral 7B Instruct v0.32025.09 | 52.5 | |
| Verb. conf.Model=Qwen 2.5 7B Instruct2025.09 | 51.3 | |
| Verb. conf.Model=DeepSeek R1 Distill Qwen 32B2025.09 | 50.3 | |
| DirectionModel=Llama 3.3 70B Instruct, Train dataset=TriviaQA2025.09 | 49.9 | |
| Llama 3.1Classifier=Self-Certainty2026.05 | 49.1 |