Correctness Prediction on Medals
77AUROCDirection
Evaluation Results
| Method | Links | |
|---|---|---|
| DirectionModel=Llama 3.3 70B Instruct, Train dataset=TriviaQA2025.09 | 77 | |
| DirectionModel=Llama 3.1 8B, Train dataset=TriviaQA2025.09 | 68 | |
| DirectionModel=Ministral 8B Instruct 2410, Train dataset=TriviaQA2025.09 | 67 | |
| Verb. conf.Model=Llama 3.3 70B Instruct2025.09 | 66.5 | |
| DirectionModel=Mistral 7B Instruct v0.3, Train dataset=TriviaQA2025.09 | 64.5 | |
| DirectionModel=DeepSeek R1 Distill Qwen 32B, Train dataset=TriviaQA2025.09 | 63.8 | |
| AssessorModel=Mistral 7B Instruct v0.3, Assessor type=logistic regression2025.09 | 63.8 | |
| AssessorModel=Ministral 8B Instruct 2410, Assessor type=logistic regression2025.09 | 62.6 | |
| AssessorModel=Llama 3.1 8B, Assessor type=logistic regression2025.09 | 62.3 | |
| AssessorModel=Qwen 2.5 7B Instruct, Assessor type=logistic regression2025.09 | 62.2 | |
| AssessorModel=DeepSeek R1 Distill Qwen 32B, Assessor type=logistic regression2025.09 | 60.1 | |
| DirectionModel=Qwen 2.5 7B Instruct, Train dataset=TriviaQA2025.09 | 58.6 | |
| AssessorModel=Llama 3.3 70B Instruct, Assessor type=logistic regression2025.09 | 56.8 | |
| Verb. conf.Model=DeepSeek R1 Distill Qwen 32B2025.09 | 56.3 | |
| Verb. conf.Model=Mistral 7B Instruct v0.32025.09 | 55.8 | |
| Verb. conf.Model=Qwen 2.5 7B Instruct2025.09 | 53.1 | |
| Verb. conf.Model=Ministral 8B Instruct 24102025.09 | 50.2 | |
| Verb. conf.Model=Llama 3.1 8B2025.09 | 50 |