Multimodal Understanding on MMStar (test)
71.6AccuracyPVM-8B (SFT + GRPO)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PVM-8B (SFT + GRPO)Backbone=8B, Training Strategy=SFT + GRPO, Model Architecture=Persistent Visual Memory2026.05 | 71.6 | — | |
| PEARL-8BBackbone=8B, Training Strategy=RL-tuned2026.05 | 71.5 | — | |
| Euclid-8BBackbone=8B, Training Strategy=RL-tuned2026.05 | 71.3 | — | |
| OneThinker-8BBackbone=8B, Training Strategy=RL-tuned2026.05 | 71.2 | — | |
| PVM-8B (SFT)Backbone=8B, Training Strategy=SFT, Model Architecture=Persistent Visual Memory2026.05 | 71.2 | — | |
| Qwen3-VL-8B (LoRA-SFT + GRPO)Backbone=8B, Training Strategy=LoRA-SFT + GRPO2026.05 | 71 | — | |
| Qwen3-VL-8B (LoRA-SFT)Backbone=8B, Training Strategy=LoRA-SFT2026.05 | 70.2 | — | |
| CoMemoTraining Strategy=Visual Injection2026.05 | 69.9 | — | |
| ICoTTraining Strategy=Visual Injection2026.05 | 69.3 | — | |
| PVM-4B (SFT + GRPO)Backbone=4B, Training Strategy=SFT + GRPO, Model Architecture=Persistent Visual Memory2026.05 | 69.2 | — | |
| Qwen3-VL-4B (LoRA-SFT + GRPO)Backbone=4B, Training Strategy=LoRA-SFT + GRPO2026.05 | 69 | — | |
| Qwen3-VL-8B-InstructBackbone=8B2026.05 | 68.7 | — | |
| Qwen3-VL-8B (SFT + GRPO)Backbone=8B, Training Strategy=SFT + GRPO2026.05 | 68.6 | — | |
| PVM-4B (SFT)Backbone=4B, Training Strategy=SFT, Model Architecture=Persistent Visual Memory2026.05 | 67.9 | — | |
| Qwen3-VL-8B (SFT)Backbone=8B, Training Strategy=SFT2026.05 | 67.7 | — | |
| Qwen3-VL-4B (SFT)Backbone=4B, Training Strategy=SFT2026.05 | 67.7 | — | |
| Qwen3-VL-4B-InstructBackbone=4B2026.05 | 66.7 | — | |
| Qwen3-VL-4B (LoRA-SFT)Backbone=4B, Training Strategy=LoRA-SFT2026.05 | 66.7 | — | |
| MemVRTraining Strategy=Visual Injection2026.05 | 65.4 | — | |
| Qwen3-VL-4B (SFT + GRPO)Backbone=4B, Training Strategy=SFT + GRPO2026.05 | 65.1 | — | |
| Qwen2.5VLSize=7B, Type=AR, Samples=>9M2025.12 | 63.9 | — | |
| DiffusionVLSize=7B, Type=Diff., Samples=738K2025.12 | 63.2 | — | |
| LLaVA-OVSize=7B, Type=AR, Samples=7.8M2025.12 | 61.7 | — | |
| LLaDA-VSize=8B, Type=Diff., Samples=16.5M2025.12 | 60.1 | — | |
| Qwen2.5VLSize=3B, Type=AR, Samples=>9M2025.12 | 55.9 | — | |
| DiffusionVLSize=3B, Type=Diff., Samples=738K2025.12 | 55.9 | — | |
| FasterVLMImage token reduction ratio=66.7%2024.12 | — | 61.1 | |
| FasterVLMImage token reduction ratio=77.8%2024.12 | — | 60.5 | |
| FasterVLMImage token reduction ratio=88.9%2024.12 | — | 58.5 | |
| iLLaVAImage token reduction ratio=66.7%2024.12 | — | 62.8 | |
| iLLaVAImage token reduction ratio=77.8%2024.12 | — | 61.6 | |
| iLLaVAImage token reduction ratio=88.9%2024.12 | — | 60.5 | |
| PyramidDropImage token reduction ratio=66.7%2024.12 | — | 60.9 | |
| PyramidDropImage token reduction ratio=77.8%2024.12 | — | 58.6 | |
| PyramidDropImage token reduction ratio=88.9%2024.12 | — | 55.1 | |
| SparseVLMImage token reduction ratio=66.7%2024.12 | — | 61.9 | |
| SparseVLMImage token reduction ratio=77.8%2024.12 | — | 60.1 | |
| SparseVLMImage token reduction ratio=88.9%2024.12 | — | 58 | |
| VanillaMode=Upper bound2024.12 | — | 63.9 | |
| VisionZipImage token reduction ratio=66.7%2024.12 | — | 62.1 | |
| VisionZipImage token reduction ratio=77.8%2024.12 | — | 61.3 | |
| VisionZipImage token reduction ratio=88.9%2024.12 | — | 58.8 |