Multimodal Math Reasoning on R1-OV Bench
38.9AccuracyAVATAR
Evaluation Results
| Method | Links | |
|---|---|---|
| AVATARbackbone=Qwen2.5-VL-7B2025.08 | 38.9 | |
| AVATARbackbone=Qwen2.5-VL-7B, ablation=w/o Replay Buffer (on-policy)2025.08 | 38.5 | |
| VLAAThinker-VL-7B2025.08 | 38.4 | |
| AVATARbackbone=Qwen2.5-VL-7B, ablation=w/o TAS (uniform credit)2025.08 | 37.5 | |
| AVATARbackbone=Qwen2.5-VL-7B, ablation=w/o Hinting2025.08 | 37 | |
| Qwen2.5-VL-7B + GRPOtraining=GRPO2025.08 | 36.8 | |
| Qwen2.5-VL-7Bstatus=Baseline2025.08 | 34.9 | |
| OpenVLThinker-7B2025.08 | 34.7 |