Student Misconception Classification on Algebra Misconception Benchmark
87.5MAP@3Qwen-3-4B + Ours
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen-3-4B + OursEvaluation Protocol=Two-Stage Distillation2026.05 | 87.5 | 89.15 | 84.38 | 45.31 | |
| Qwen-2.5-72BEvaluation Protocol=Fine-tuned2026.05 | 84.38 | 86.12 | 81.25 | 43.75 | |
| Gemma-2-9B + OursEvaluation Protocol=Two-Stage Distillation2026.05 | 80.15 | 81.55 | 76.56 | 43.75 | |
| Llama-3.1-8B + OursEvaluation Protocol=Two-Stage Distillation2026.05 | 78.65 | 79.95 | 75.64 | 42.81 | |
| Llama-3.1-8BEvaluation Protocol=Fine-tuned2026.05 | 77.6 | 79.17 | 75 | 40.62 | |
| Gemma-2-9BEvaluation Protocol=Fine-tuned2026.05 | 77.08 | 78.62 | 71.88 | 42.19 | |
| Qwen-3-4BEvaluation Protocol=Fine-tuned2026.05 | 75.52 | 76.69 | 71.88 | 40.62 | |
| GPT-5Evaluation Protocol=Prompting2026.05 | 74.09 | 74.18 | 67.73 | 40.91 | |
| Claude-4-SonnetEvaluation Protocol=Prompting2026.05 | 66.36 | 66.45 | 56.36 | 39.32 | |
| GPT-OSS-120BEvaluation Protocol=Prompting2026.05 | 65.5 | 65.59 | 56.8 | 37.25 | |
| DeepSeek-V3Evaluation Protocol=Prompting2026.05 | 64.85 | 64.94 | 55.45 | 38.15 | |
| Qwen-2.5-72BEvaluation Protocol=Prompting2026.05 | 62.8 | 62.89 | 53.2 | 36.7 |