Automated Grading on Synthetic Bilingual Dataset
0.936Human Spearman RhoQwen3-8B Fine-tuned
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Qwen3-8B Fine-tunedToken Length=892026.06 | 0.936 | 0.725 | 0.819 | 0.471 | 0.715 | 0.714 | 6.8 | |
| Claude Sonnet 4Token Length=1642026.06 | 0.919 | 0.903 | 0.653 | 0.428 | 0.703 | 0.688 | 6.18 | |
| Gemini 3 FlashToken Length=1262026.06 | 0.91 | 1.12 | 0.776 | 0.439 | 0.752 | 0.712 | 6.7 | |
| Qwen3-8B (base)Token Length=932026.06 | 0.904 | 1.174 | 0.79 | 0.458 | 0.727 | 0.721 | 6.74 | |
| GPT-5.2Token Length=1472026.06 | 0.902 | 1.112 | 0.609 | 0.413 | 0.734 | 0.715 | 6.18 | |
| Sonar ReasoningToken Length=1962026.06 | 0.892 | 0.992 | 0.667 | 0.464 | 0.684 | 0.638 | 6.13 | |
| LLaMA 3.2Token Length=1432026.06 | 0.778 | 1.752 | 0.674 | 0.432 | 0.692 | 0.715 | 6.28 |