Mathematical Reasoning on DynaMath (Avg@3)
58.7Avg@3ADORA
Evaluation Results
| Method | Links | |
|---|---|---|
| ADORABackbone=Qwen2.5-VL-7B, RL Algorithm=GRPO + ADORA2026.02 | 58.7 | |
| Vision-R1-7B2026.02 | 56.3 | |
| GRPOBackbone=Qwen2.5-VL-7B, RL Algorithm=GRPO2026.02 | 53.3 | |
| Qwen2.5-VL-7BRL Algorithm=None2026.02 | 50.3 | |
| ADORABackbone=Internvl3-2b, RL Algorithm=GRPO + ADORA2026.02 | 18.1 | |
| GRPOBackbone=Internvl3-2b, RL Algorithm=GRPO2026.02 | 15.1 | |
| Internvl3-2bRL Algorithm=None2026.02 | 14.6 | |
| ADORABackbone=Gemma3-4b-it, RL Algorithm=GRPO + ADORA2026.02 | 12.2 | |
| GRPOBackbone=Gemma3-4b-it, RL Algorithm=GRPO2026.02 | 11 | |
| Gemma3-4b-itRL Algorithm=None2026.02 | 10.5 |