Correctness Detection on SciQ, CSQA, FEVER (average)
0.69AUCQwen2-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2-7BModel Type=Instruction-tuned, Zero-shot transfer evaluation=true2026.02 | 0.69 | 0.21 | |
| Qwen2-1.5BModel Type=Instruction-tuned, Zero-shot transfer evaluation=true2026.02 | 0.65 | 0.23 | |
| Llama-1BModel Type=Instruction-tuned, Zero-shot transfer evaluation=true2026.02 | 0.63 | 0.29 | |
| GPT-2-MedModel Type=Base models, Zero-shot transfer evaluation=true2026.02 | 0.56 | 0.19 | |
| GPT-2-LargeModel Type=Base models, Zero-shot transfer evaluation=true2026.02 | 0.56 | 0.19 | |
| GPT-2Model Type=Base models, Zero-shot transfer evaluation=true2026.02 | 0.51 | 0.22 |