Multimodal Reasoning on VSP IID
82.8AccuracyILVR
Evaluation Results
| Method | Links | |
|---|---|---|
| ILVRBackbone=Qwen3-VL-8B, Paradigm=Interleaved, Training Stage=Stage 2: Latent Relaxation2025.12 | 82.8 | |
| ILVRBackbone=Qwen2.5-VL-7B, Paradigm=Interleaved, Training Stage=Stage 2: Latent Relaxation2025.12 | 81.5 | |
| MirageBackbone=Qwen3-VL-8B, Paradigm=Single-step, Training Stage=Stage 2: Latent Relaxation2025.12 | 78.3 | |
| ILVRBackbone=Qwen2.5-VL-7B, Paradigm=Interleaved, Training Stage=Stage 1: Latent Alignment2025.12 | 77.3 | |
| MirageBackbone=Qwen2.5-VL-7B, Paradigm=Single-step, Training Stage=Stage 2: Latent Relaxation2025.12 | 76 | |
| ILVRBackbone=Qwen3-VL-8B, Paradigm=Interleaved, Training Stage=Stage 1: Latent Alignment2025.12 | 75 | |
| Direct-FTBackbone=Qwen2.5-VL-7B, Paradigm=Direct Ans., Training Stage=Standard2025.12 | 72 | |
| MirageBackbone=Qwen3-VL-8B, Paradigm=Single-step, Training Stage=Stage 1: Latent Alignment2025.12 | 71.3 | |
| MirageBackbone=Qwen2.5-VL-7B, Paradigm=Single-step, Training Stage=Stage 1: Latent Alignment2025.12 | 65.8 | |
| CoT-FTBackbone=Qwen3-VL-8B, Paradigm=Text CoT, Training Stage=Standard2025.12 | 61.8 | |
| Direct-FTBackbone=Qwen3-VL-8B, Paradigm=Direct Ans., Training Stage=Standard2025.12 | 60.8 | |
| CoT-FTBackbone=Qwen2.5-VL-7B, Paradigm=Text CoT, Training Stage=Standard2025.12 | 47 | |
| Zero-shotBackbone=Qwen3-VL-8B, Paradigm=Direct Ans., Training Stage=Standard2025.12 | 19 | |
| Zero-shotBackbone=Qwen2.5-VL-7B, Paradigm=Direct Ans., Training Stage=Standard2025.12 | 6 |