Complex Reasoning on LLaVA-Bench Wilder
74.3ScoreQwen3-VL-4B (Base)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-4B (Base)Base Model=Qwen3-VL-4B, Alignment Strategy=Base2026.06 | 74.3 | |
| COPSD (Standard)Base Model=Qwen3-VL-4B, Alignment Strategy=COPSD (Standard)2026.06 | 74.1 | |
| COPSD (Hybrid)Base Model=Qwen3-VL-4B, Alignment Strategy=COPSD (Hybrid)2026.06 | 73.4 | |
| OPDBase Model=Qwen3-VL-4B, Alignment Strategy=OPD2026.06 | 70.5 | |
| SFTBase Model=Qwen3-VL-4B, Alignment Strategy=SFT2026.06 | 70.4 | |
| Qwen2.5-VL-7B (Base)Base Model=Qwen2.5-VL-7B, Alignment Strategy=Base2026.06 | 69.9 | |
| COPSD (Standard)Base Model=Qwen2.5-VL-7B, Alignment Strategy=COPSD (Standard)2026.06 | 69.4 | |
| COPSD (Hybrid)Base Model=Qwen2.5-VL-7B, Alignment Strategy=COPSD (Hybrid)2026.06 | 68.5 | |
| GRPOBase Model=Qwen3-VL-4B, Alignment Strategy=GRPO2026.06 | 68.2 | |
| OPDBase Model=Qwen2.5-VL-7B, Alignment Strategy=OPD2026.06 | 67.2 | |
| GRPOBase Model=Qwen2.5-VL-7B, Alignment Strategy=GRPO2026.06 | 67 | |
| SFTBase Model=Qwen2.5-VL-7B, Alignment Strategy=SFT2026.06 | 66.7 | |
| Safe-RLHF-VBase Model=Qwen3-VL-4B, Alignment Strategy=Safe-RLHF-V2026.06 | 56.8 | |
| Safe-RLHF-VBase Model=Qwen2.5-VL-7B, Alignment Strategy=Safe-RLHF-V2026.06 | 52.3 |