MLLM-as-a-judge evaluation on M-JudgeBench
67.45Pairwise CoT AccuracyM-Judger-RL-Qwen8B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| M-Judger-RL-Qwen8B2026.02 | 67.45 | 44.53 | 92.14 | 62.42 | |
| M-Judger-SFT-Qwen8B2026.02 | 66.86 | 34.22 | 90.79 | 57.46 | |
| Qwen3-VL-8B-InstructTraining=+ SFT (only open-source)2026.02 | 64.59 | 26.15 | 92.55 | 53.48 | |
| Qwen3-VL-8B-Instruct2026.02 | 63.56 | 24.66 | 84.14 | 50.78 | |
| M-Judger-RL-Qwen4B2026.02 | 63.12 | 43.98 | 94.04 | 60.96 | |
| M-Judger-SFT-Qwen4B2026.02 | 60.4 | 38.14 | 92.14 | 57 | |
| Qwen3-VL-4B-Instruct2026.02 | 59.02 | 31.49 | 73.71 | 50 | |
| Qwen3-VL-4B-InstructTraining=+ SFT (only open-source)2026.02 | 58.93 | 23.85 | 94.85 | 50.81 | |
| UnifiedReward-Think-qwen-7b2026.02 | 55.5 | 23.98 | 81.03 | 46.9 | |
| R1-Reward2026.02 | 51.98 | 25.4 | 72.49 | 44.53 |