Reasoning on CorrectBench
0.8256AccuracyMP
Evaluation Results
| Method | Links | |
|---|---|---|
| MPModel=Qwen-3-8B, Prompting Strategy=Metacognitive Prompting2026.02 | 0.8256 | |
| Ann BrownModel=Qwen-3-8B, Prompting Strategy=Ann Brown Prompting2026.02 | 0.8256 | |
| CoTModel=Qwen-3-8B, Prompting Strategy=Chain-of-Thought2026.02 | 0.8215 | |
| StdModel=Qwen-3-8B, Prompting Strategy=Standard2026.02 | 0.7903 | |
| CoTModel=Llama-3-8B, Prompting Strategy=Chain-of-Thought2026.02 | 0.7502 | |
| MPModel=Llama-3-8B, Prompting Strategy=Metacognitive Prompting2026.02 | 0.7486 | |
| Ann BrownModel=Llama-3-8B, Prompting Strategy=Ann Brown Prompting2026.02 | 0.6814 | |
| StdModel=Llama-3-8B, Prompting Strategy=Standard2026.02 | 0.5291 |