Mathematical Reasoning on Minerva (acc@1, Overall)
52.5Overall ScoreVM-AV-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VM-AV-GRPOAlgorithm=VM-AV-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 52.5 | 24.3 | |
| AV-GRPOAlgorithm=AV-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 50.9 | 26.8 | |
| MSA-GRPOAlgorithm=MSA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 50.7 | 24.3 | |
| FA-GRPOAlgorithm=FA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 49.9 | 22.4 | |
| PR-GRPOAlgorithm=PR-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 49.4 | 23.9 | |
| CDA-GRPOAlgorithm=CDA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 49 | 25 | |
| SVE-LNA-GRPOAlgorithm=SVE-LNA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 48.7 | 23.2 | |
| GRPOAlgorithm=GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | 47.8 | 24.6 | |
| IDPOModel=Qwen3-8B2025.05 | 38.8 | — | |
| SAI-DPOModel=Qwen3-8B2025.05 | 37.6 | — | |
| Base ModelModel=Qwen3-8B2025.05 | 34.9 | — | |
| Base ModelModel=Qwen2.5-7B-Math-SFT2025.05 | 32 | — | |
| SAI-DPOModel=Qwen2.5-7B-Math-Base2025.05 | 31.7 | — | |
| SAI-DPOModel=Qwen2.5-7B-Math-SFT2025.05 | 31.3 | — | |
| IDPOModel=Qwen2.5-7B-Math-Base2025.05 | 30.4 | — | |
| IDPOModel=Qwen2.5-7B-Math-SFT2025.05 | 29.9 | — | |
| SAI-DPOModel=Llama3.1-8B-Instruct2025.05 | 19.6 | — | |
| IDPOModel=Llama3.1-8B-Instruct2025.05 | 19.4 | — | |
| Base ModelModel=Llama3.1-8B-Instruct2025.05 | 16.5 | — | |
| Base ModelModel=Qwen2.5-7B-Math-Base2025.05 | 12.1 | — |