Correctness Prediction on Math operations
0.913AUROCVerb. conf.
Evaluation Results
| Method | Links | |
|---|---|---|
| Verb. conf.Model=Llama 3.3 70B Instruct2025.09 | 0.913 | |
| DirectionModel=Llama 3.1 8B, Train dataset=TriviaQA2025.09 | 0.858 | |
| DirectionModel=DeepSeek R1 Distill Qwen 32B, Train dataset=TriviaQA2025.09 | 0.847 | |
| DirectionModel=Ministral 8B Instruct 2410, Train dataset=TriviaQA2025.09 | 0.844 | |
| DirectionModel=Qwen 2.5 7B Instruct, Train dataset=TriviaQA2025.09 | 0.837 | |
| DirectionModel=Llama 3.3 70B Instruct, Train dataset=TriviaQA2025.09 | 0.835 | |
| DirectionModel=Mistral 7B Instruct v0.3, Train dataset=TriviaQA2025.09 | 0.782 | |
| Verb. conf.Model=Llama 3.1 8B2025.09 | 0.623 | |
| Verb. conf.Model=Mistral 7B Instruct v0.32025.09 | 0.617 | |
| AssessorModel=Llama 3.1 8B, Assessor type=logistic regression2025.09 | 0.528 | |
| Verb. conf.Model=Qwen 2.5 7B Instruct2025.09 | 0.517 | |
| Verb. conf.Model=Ministral 8B Instruct 24102025.09 | 0.5 | |
| Verb. conf.Model=DeepSeek R1 Distill Qwen 32B2025.09 | 0.499 | |
| AssessorModel=Mistral 7B Instruct v0.3, Assessor type=logistic regression2025.09 | 0.493 | |
| AssessorModel=Ministral 8B Instruct 2410, Assessor type=logistic regression2025.09 | 0.454 | |
| AssessorModel=Llama 3.3 70B Instruct, Assessor type=logistic regression2025.09 | 0.449 | |
| AssessorModel=Qwen 2.5 7B Instruct, Assessor type=logistic regression2025.09 | 0.4 | |
| AssessorModel=DeepSeek R1 Distill Qwen 32B, Assessor type=logistic regression2025.09 | 0.337 |