Multi-modal Chain-of-Thought Reasoning on MME CoT
64.2F1 ScoreKimi k1.5
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Kimi k1.52025.10 | 64.2 | 92 | 49.3 | 1.4 | 2.9 | 0 | 82.2 | 92.2 | 72.2 | |
| GPT-4o2025.10 | 64 | 85.4 | 51.2 | 2.1 | -1 | 5.1 | 96 | 92 | 100 | |
| Qwen2-VL-72BModel Size=72B2025.10 | 56.2 | 77.3 | 44.2 | -2.1 | -6.5 | 2.4 | 96.5 | 92.9 | 100 | |
| NoisyGRPOBase Model=Qwen2.5-VL, Model Size=7B2025.10 | 47.7 | 64.8 | 37.7 | 3.9 | 7.8 | -0.1 | 59.7 | 81.8 | 37.5 | |
| GRPOBase Model=Qwen2.5-VL, Model Size=7B2025.10 | 46.8 | 64.2 | 36.9 | 1.6 | 3.8 | -0.6 | 66.4 | 87.2 | 45.7 | |
| InternVL2.5-8B-MPOModel Size=8B2025.10 | 43 | 60.4 | 33.4 | 0.6 | 0.3 | 0.9 | 94.7 | 89.3 | 100 | |
| NoisyGRPOBase Model=Qwen2.5-VL, Model Size=3B2025.10 | 40.6 | 57.3 | 31.5 | -2.4 | -2.4 | -2.4 | 55.4 | 71.9 | 38.8 | |
| MiniCPM-V-2.62025.10 | 39.8 | 57.3 | 30.5 | -3.5 | -4.8 | -2.2 | 92.8 | 85.7 | 100 | |
| LLaVA-OV-72BModel Size=72B2025.10 | 36.3 | 57.3 | 26.6 | -0.2 | 0.3 | -0.6 | 95.4 | 90.8 | 100 | |
| GRPOBase Model=Qwen2.5-VL, Model Size=3B2025.10 | 36.2 | 53 | 27.4 | -7 | -7.5 | -6.5 | 51.1 | 76.3 | 26 | |
| LLaVA-OV-7BModel Size=7B2025.10 | 30.9 | 50.9 | 22.2 | -3.4 | -3.8 | -3 | 91.5 | 83 | 100 |