Multimodal Reasoning on MMK12
81.8AccuracyVPPO-RL-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| VPPO-RL-7BModel Scale=7B2026.05 | 81.8 | |
| EASE-7BModel Scale=7B2026.05 | 81.6 | |
| VGPO-7BModel Scale=7B2026.05 | 81.5 | |
| PAPO_D-7BModel Scale=7B2026.05 | 80.8 | |
| PAPOGBackbone=Qwen2.5-VL-7B2026.06 | 72.35 | |
| GRPOBackbone=Qwen2.5-VL-7B2026.06 | 72.26 | |
| CFPOGBackbone=Qwen2.5-VL-7B, Hyperparameters=gamma=0.02 + No Ent2026.06 | 71.61 | |
| VL-Rethinker-7BModel Scale=7B2026.05 | 66 | |
| MSSRModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 62.5 | |
| MM-Eureka-Qwen-7BTraining Protocol=Zero RL2025.12 | 61.7 | |
| MM-Eureka-7BModel Scale=7B2026.05 | 61.7 | |
| ThinkLite-VL-7BTraining Protocol=Zero RL2025.12 | 57.6 | |
| RLOOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 56 | |
| GRPOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 55.8 | |
| OpenVLThinker-7BTraining Protocol=SFT + RL2025.12 | 53.5 | |
| VLAA-Thinker-7BTraining Protocol=SFT + RL2025.12 | 51.7 | |
| REINFORCE++Model=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 51.3 | |
| NoisyRollout-7BModel Scale=7B2026.05 | 51.2 | |
| ThinkLite-VL-7BModel Scale=7B2026.05 | 50.5 | |
| MSSRModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 49.2 | |
| PAPOGBackbone=Qwen3-VL-2B-Thinking2026.06 | 48.57 | |
| Qwen2.5-VL-7BTraining Protocol=Zero RL2025.12 | 48.1 | |
| CFPOGBackbone=Qwen3-VL-2B-Thinking2026.06 | 48.04 | |
| GRPOBackbone=Qwen3-VL-2B-Thinking2026.06 | 47.71 | |
| GRPOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 46.1 | |
| REINFORCE++Model=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 46 | |
| RLOOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 45.5 | |
| R1-Onevision-7BTraining Protocol=SFT + RL2025.12 | 43.5 | |
| Qwen2.5-VL-3BTraining Protocol=Zero RL2025.12 | 42.5 |